Pith. sign in

Paper Citation Record · LEDGER

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models

As of 7 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2507.18182.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.18182 v2

Coverage vector

measured 78 of 78 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T14:45:42.780856Z

measured 79 of 79 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T17:21:27.531024Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

78 of 78 outbound references displayed

  • verified exact4
  • verified fuzzy40
  • unresolved34
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5216c661-9e79-4deb-9ee1-06cda3c739d5 · outbound

This paper cites GPT-4 Technical Report.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.561961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.561961Z digest=sha256:94f181de65417d213ad03a6779547e4d479355550eb6abed5fa2c3e21337f5d1

Observation cb2282c2-f384-4bd5-b127-3f706c3f7a62 · outbound

This paper cites Sparks of Artificial General Intelligence: Early experiments with GPT-4.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Sparks of Artificial General Intelligence: Early experiments with GPT-4

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.566066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.566066Z digest=sha256:f3372b3ddc276c29dc93dbe5e3c5ac3d3dab5873b78323f39a97b1c40ee28126

Observation 2760630c-638e-44ae-86a4-a0c55b30d2d3 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models LLaMA: Open and Efficient Foundation Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.569568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.569568Z digest=sha256:20a7f871331b432e2b715daf9a2515fa0ae2c60385d0890596a220aa4e4dc2b9

Observation f9293f9f-fa3a-444a-b726-edeaf7c1a832 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.572487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.572487Z digest=sha256:20eca2886285cf48781ddbf19cb1f13a863a915b871e93af56d04bd94d28f670

Observation 218de190-04dc-4364-95d0-850a2e06143d · outbound

This paper cites The economic potential of generative ai: The next productivity frontier, 2023.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models The economic potential of generative ai: The next productivity frontier, 2023

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.621636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.575869Z digest=sha256:20a4536e997a9bac8b99bec32a4f1c5fdd62065becb24ba186a5481dc84cc15c

Observation a77f83e9-b076-47b2-bab1-54b48e044733 · outbound

This paper cites Pwc is accelerating adoption of ai with chatgpt enterprise in us and uk and with clients, 2024.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Pwc is accelerating adoption of ai with chatgpt enterprise in us and uk and with clients, 2024

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.612570Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.579151Z digest=sha256:4fb5648d24a52b20d68d05b42fefc1f9f6f57832542496b3479e2f4d7f10dd20

Observation 8d2d8d73-ee8e-4180-82a9-32fcbcc1dac6 · outbound

This paper cites Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.582894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.582894Z digest=sha256:3b291cabac4cd9211502d61a3d6933f33fc209f517297430121b1975ada93d02

Observation 58eb326e-4fdb-4ed6-9560-5333f4283e41 · outbound

This paper cites Shortcut learning of large language models in natural language understanding.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Shortcut learning of large language models in natural language understanding

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.603251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.585882Z digest=sha256:29a55e15bd496278e3d8f63d10143a80a89c2ddcc6def6450b1c85352e5c1e7e

Observation f349f8bc-052c-40fb-9d71-1c872ffe3904 · outbound

This paper cites Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:45:43.145432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.591793Z digest=sha256:bdfbf6c2fa22aae0a79fc076207e02865ab3ea8c2d6145165a4fd43e929aad6d

Observation 48e8a152-485c-49e4-9a07-f5963bc2dd57 · outbound

This paper cites CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-Judges.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models CalibraEval: Calibrating Prediction Distribution to Mitigate Selection Bias in LLMs-as-Judges

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.595463Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.595463Z digest=sha256:c8a20ea376256b5dee2dba269f1898c2beb92e984e230db965cfd2d20cc1de9c

Observation 804d4f28-d333-42c6-9101-1f053eb2d790 · outbound

This paper cites Look at the Text: Instruction-Tuned Language Models are More Robust Multiple Choice Selectors than You Think.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Look at the Text: Instruction-Tuned Language Models are More Robust Multiple Choice Selectors than You Think

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:45:43.124439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.598610Z digest=sha256:b81451694be7a21c9e47dc05d8ac608eaf2546a6d562f1ca33de1bb98d6faadf

Observation e2ddc13a-a790-4983-8e6b-0df7fcbf2a43 · outbound

This paper cites Language models are few-shot learners.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Language models are few-shot learners

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.601429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.601429Z digest=sha256:3f6f7030bd47c38a1a19980202fb63f5448bc25b5a55c06b0d598dec99e8f5c7

Observation 0cc113ea-39ac-4f19-a6ef-57a2f6c3590c · outbound

This paper cites Exploring the limits of transfer learning with a unified text-to-text transformer.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Exploring the limits of transfer learning with a unified text-to-text transformer

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.604125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.604125Z digest=sha256:0fd7b2f345debd538b399cb115a7b235af5534a84664e71cdf562b35fc0dfff8

Observation d5ea368c-46eb-4423-8f61-3f20b0bb8b88 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Measuring Massive Multitask Language Understanding

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.607027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.607027Z digest=sha256:2da3446535b33b98f4c9b583c96fc8c2f643ba0efbbfe961105f6df904c481e1

Observation 792dc029-15b8-4a49-bf2f-6bb7d7223cfd · outbound

This paper cites Commonsenseqa: A question answering challenge targeting commonsense knowledge.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Commonsenseqa: A question answering challenge targeting commonsense knowledge

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.581828Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.609512Z digest=sha256:5714e2536e4b857ee42ea6aeb7d0772b075d0f069d28519c31d2df6974c570e2

Observation ca26ebfc-5895-458f-80aa-cdd3cebe1982 · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.612530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.612530Z digest=sha256:02fbffcfc5e612f849f82b1e50d9651588b0ec5522e5be737e700c174a966a24

Observation ad484efe-39c1-4c9f-9489-a11f91e62622 · outbound

This paper cites Can a suit of armor conduct electricity? a new dataset for open book question answering.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Can a suit of armor conduct electricity? a new dataset for open book question answering

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.615299Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.615299Z digest=sha256:2f8a201a1d515117c0cca32f339fd341cb6a29dda47d7f8e3934b534cfee68e2

Observation bd3fae3e-6895-46f2-8f8a-9d697081e08e · outbound

This paper cites Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Beyond the imitation game: Quantifying and extrapolating the capabilities of language models

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.567456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.618154Z digest=sha256:f479a44fc0adac1f4333d2a17d15a09946c9d9c954ea7116ad6fc6666f212ffb

Observation b91a51a6-a339-4d1e-b70a-3fb91eafeb9b · outbound

This paper cites Holistic Evaluation of Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Holistic Evaluation of Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.620508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.620508Z digest=sha256:96600e66771e37d8850b99123aa17f74a220b29c8a261ae77eb0c19c7c496342

Observation a999ef10-10e4-4015-be27-90b254a96c08 · outbound

This paper cites M3exam: A multilingual, multimodal, multilevel benchmark for examining large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models M3exam: A multilingual, multimodal, multilevel benchmark for examining large language models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.558566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.623159Z digest=sha256:1636ac59f110af480e09baafbae2597c79c77453a4e30d4ac285782c1ca44244

Observation 8123bda6-f4b8-46fc-8f07-d6a3cbaaecc7 · outbound

This paper cites Agieval: A human-centric benchmark for evaluating foundation models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Agieval: A human-centric benchmark for evaluating foundation models

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.549898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.625905Z digest=sha256:343379658a294bf3d82faf85c4ba10c5ac207085543a1c9369307405d8e4d352

Observation d3e3c2aa-2ceb-4a65-8b2d-724c83c9f536 · outbound

This paper cites Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.628168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.628168Z digest=sha256:ed0fe23fe4defebc1f5839f6b48b484300105126598268ff47ff3d9993ea2755

Observation df6b1510-bd09-462b-9813-4e35ba20437d · outbound

This paper cites Crowdsourcing multiple choice science questions.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Crowdsourcing multiple choice science questions

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.630597Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.630597Z digest=sha256:e8e479bc2efe97b7fecf670f3a607b446322df6f375d5c6ee8d8f79f84e7d263

Observation 0d09c583-8dd4-40cc-b490-2e0d5ca64a9d · outbound

This paper cites From live data to high-quality benchmarks: The arena-hard pipeline.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models From live data to high-quality benchmarks: The arena-hard pipeline

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.529542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.632984Z digest=sha256:e98ea4e528c8f78510d7a6ff5a28bdd028be671f18cdd9379ed46e34c675b178

Observation e3db5bdc-e636-4f69-a407-95adab2f9f80 · outbound

This paper cites Chatbot arena: An open platform for evaluating llms by human preference.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Chatbot arena: An open platform for evaluating llms by human preference

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.635387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.635387Z digest=sha256:5e1a0c82c6a885ca0510235133ef1eea7842fd858f2903511c481a7cea9d2efb

Observation 9f7a62ba-9fde-4987-ae00-0777e92a8a65 · outbound

This paper cites Large language models are not fair evaluators.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large language models are not fair evaluators

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.514598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.638295Z digest=sha256:d3e4b866b1a9caaf9c735bd62f07c05cb1f9bbccfdacb2c082b981f452121f70

Observation ab2c8cd0-06b0-4f5d-9b3f-6be3e265e722 · outbound

This paper cites Apbench and benchmarking large language model performance in fundamental astrodynamics problems for space engineering.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Apbench and benchmarking large language model performance in fundamental astrodynamics problems for space engineering

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.505622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.640769Z digest=sha256:70d49f078cc9b35d3faf3512eb9ac5e8857062b9586110ee600a66756f7710a1

Observation ecf966ea-e5af-4d75-a462-0c8c733f6360 · outbound

This paper cites Where is the answer? an empirical study of positional bias for parametric knowledge extraction in language model.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Where is the answer? an empirical study of positional bias for parametric knowledge extraction in language model

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.495745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.643189Z digest=sha256:00d95b331747052355b36cb9cc83bac6598f99e61d0a8a3a04f1b6203f10037f

Observation 64cad35f-936a-4df2-9b8a-c5f5aff12226 · outbound

This paper cites Option symbol matters: Investigating and mitigating multiple-choice option symbol bias of large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Option symbol matters: Investigating and mitigating multiple-choice option symbol bias of large language models

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.485373Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.645709Z digest=sha256:097a578ebea62f04a6a2c1380c488cff03e33d2018de05d6fe1f921eaff3bc14

Observation 0627c88b-3464-416e-bfce-57c47b93af5b · outbound

This paper cites Large language models sensitivity to the order of options in multiple- choice questions.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large language models sensitivity to the order of options in multiple- choice questions

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.476599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.648245Z digest=sha256:69631d45f4260b44ae236545dc7b85170cc1f318f81643472cbfa5d8d4146acb

Observation 23bf2d76-da00-464e-8b44-1cf3feee1a49 · outbound

This paper cites Large Language Models Are Not Robust Multiple Choice Selectors.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large Language Models Are Not Robust Multiple Choice Selectors

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.650856Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.650856Z digest=sha256:f32877603c874806585c55c1a2ead6f4526ee2fa53f283ed6b07bb41e02cc279

Observation fee25609-a4fd-4c9e-b357-493252f824f9 · outbound

This paper cites Fool your (vision and) language model with embarrassingly simple permutations.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Fool your (vision and) language model with embarrassingly simple permutations

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.467133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.653438Z digest=sha256:cf28d1a05e83e2a56d037d87ac543223c96efede207e5eaf311c293fb86fbd54

Observation 4fd8a892-a18c-4df6-acf8-52a6a94ba69c · outbound

This paper cites Teacher-student training for debiasing: General permutation debiasing for large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Teacher-student training for debiasing: General permutation debiasing for large language models

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.458257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.656108Z digest=sha256:9ea5f00c6cab401df6f551f3b154ac526cef8e72936d08ab267e6b11e9ddcda2

Observation 49d0fb8b-749a-4c49-a354-e988cd73e886 · outbound

This paper cites Mitigating Selection Bias with Node Pruning and Auxiliary Options.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Mitigating Selection Bias with Node Pruning and Auxiliary Options

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.658846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.658846Z digest=sha256:9b7c2b8c6166c764aab0162446cfeceb400852e1520c1d4b7ded1625dc660f01

Observation 27c90e41-76f3-4519-8ba4-c8865cdb35ec · outbound

This paper cites Unveiling selection biases: Exploring order and token sensitivity in large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Unveiling selection biases: Exploring order and token sensitivity in large language models

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.448857Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.661589Z digest=sha256:6db4859ff7e7ed90b0c017dd143612d1e5370c1833f841fbff1ed963b79fab0b

Observation c5073e1d-af59-4fab-a0aa-60dbc4c9be1b · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.664558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.664558Z digest=sha256:6031dec44bd7676f4b747d5074f4828405235825ad27379202b204311be30dd1

Observation c5c97aeb-d96c-41b5-b53c-15482b0c79ff · outbound

This paper cites Large language models are zero-shot reasoners.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large language models are zero-shot reasoners

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.667059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.667059Z digest=sha256:7c59b6a837d815e6377625b062523bee787452b49cd7c1c83660ba4b07851628

Observation 7ed7787b-ed82-49ae-9e66-846a8d6348ed · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.669715Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.669715Z digest=sha256:345714ccc992f4635cdce0d5bb3d349c8e13eff1f70453efbc6e8bf81c657275

Observation 5bbae5f3-6a6e-4388-ae67-6029fe8ad69a · outbound

This paper cites Star: Self-taught reasoner bootstrapping reasoning with reasoning.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Star: Self-taught reasoner bootstrapping reasoning with reasoning

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.427766Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.672549Z digest=sha256:d9cd3bd85986836ef11b8ebc4ee3ceb0405bbe3d059176b2072c3e9f3e80162b

Observation e06a5064-bf7a-4a76-b3ef-2bab70a4aafa · outbound

This paper cites Least-to-Most Prompting Enables Complex Reasoning in Large Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Least-to-Most Prompting Enables Complex Reasoning in Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.676271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.676271Z digest=sha256:9830df45fccebe69b63e0c138f8d2b9f5d2682821b533d912eb4b2a820d637c5

Observation 7d3b7e95-806d-40bb-8b0a-78b2baf192ec · outbound

This paper cites React: Synergizing reasoning and acting in language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models React: Synergizing reasoning and acting in language models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.680112Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.680112Z digest=sha256:80044a9ffb1ebc430bd15032586c4345bb19c7cfde004bc3f9ab383879443f5e

Observation 9d7f7b60-f742-4ed4-8262-538aa0aa21a9 · outbound

This paper cites Debiasing in-context learning by instructing llms how to follow demonstrations.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Debiasing in-context learning by instructing llms how to follow demonstrations

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.412777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.683542Z digest=sha256:341101093dcb0200066590e5913c27d9b3414c829bdfbddb1d7fad638e600dee

Observation 568a757c-58f2-439f-9301-512f20c93783 · outbound

This paper cites Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.686346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.686346Z digest=sha256:01876550783c24234b92a7f1e2f87d6fd59c7472c5a785ef1d94d4678125ea96

Observation 46c97963-d8cb-490f-b595-6a688a93b16c · outbound

This paper cites Prompt sketching for large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Prompt sketching for large language models

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.403188Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.689179Z digest=sha256:c145fd715193131497767475fe229daac6c4c20746747b645dfd01d5c0ba540f

Observation 25ae7ea6-21e6-4729-a55d-f3fa6c05b86a · outbound

This paper cites Self-refine: Iterative refinement with self-feedback.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Self-refine: Iterative refinement with self-feedback

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.691864Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.691864Z digest=sha256:9e7e5c2a3739f14a852815e1535ae15ab271dcec9434fe773afae25aaaa516bb

Observation 88a31bde-6223-435b-90a9-6c6349be6b86 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.694535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.694535Z digest=sha256:7d04fb269f3ca3aafdba22cc2e8ed2728c49cc23ad34e83cef10d42116811fd8

Observation 74233023-f874-45d8-8741-9eebd5e2d606 · outbound

This paper cites Neurologic decoding:(un) supervised neural text generation with predicate logic constraints.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Neurologic decoding:(un) supervised neural text generation with predicate logic constraints

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.389274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.697124Z digest=sha256:66839b9b9152e7ea79af1deb83c139d36c87bd18f4a440c979a24ce07e271114

Observation fe1876f5-78d7-4d4c-b641-4d40858ffdf3 · outbound

This paper cites Calibration of pre-trained transformers.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Calibration of pre-trained transformers

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.379919Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.699431Z digest=sha256:90b6cba7cde06e078d60db69a76fb6afcefde215f26ed34263e796549122e873

Observation 5ceeb87a-9260-4404-b871-4ed2589f7ac2 · outbound

This paper cites Calibrate before use: Improving few-shot performance of language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Calibrate before use: Improving few-shot performance of language models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.701730Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.701730Z digest=sha256:168457b7e7aab9e5844590d4d879944d6a6ea96b49136bbcc4517bcb7c3380a3

Observation 5f4750a8-0d4e-46bd-9a14-32a3ef571d81 · outbound

This paper cites Calibrating language models with adaptive temperature scaling.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Calibrating language models with adaptive temperature scaling

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.365364Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.704480Z digest=sha256:20375bb8283f55df2848115306c24952ae990156b25f7cbdde330dea0736cc94

Observation 291e6d06-dc20-49f7-91ee-40bff5409dc0 · outbound

This paper cites Calibrating large language models with sample consistency.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Calibrating large language models with sample consistency

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.356435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.707052Z digest=sha256:6e888125afb249a371d62de849ea5d3757efd71be29eec1c07184b3a81e5149e

Observation f28128f1-d3a7-4447-b8ad-b0a4c509c41b · outbound

This paper cites Benchmarking uncertainty quantification methods for large language models with lm-polygraph.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Benchmarking uncertainty quantification methods for large language models with lm-polygraph

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.347645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.709284Z digest=sha256:80b3d6555f9fbcf661885afa95696445a9a85e2100b170cf0f325db2dff125dd

Observation c7ad5102-cabb-474c-b834-4c0c79213041 · outbound

This paper cites Thermometer: towards universal calibration for large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Thermometer: towards universal calibration for large language models

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.338319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.711759Z digest=sha256:3934d95c8acda40cb33a07a18daf6732ad2d345a907cabd5ddbeea2ee26df618

Observation 981f2f23-405a-4692-a00e-7f33bd4543e3 · outbound

This paper cites Monte carlo temperature: a robust sampling strategy for llm’s uncertainty quantification methods.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Monte carlo temperature: a robust sampling strategy for llm’s uncertainty quantification methods

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.329636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.714104Z digest=sha256:02a665d6cdb4305041b5f470d46f24902e67250d0d97d5f328e60be68ea59776

Observation 30a565e2-2bc1-44e8-947c-a349b0dbe6b3 · outbound

This paper cites Charm: Calibrating reward models with chatbot arena scores.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Charm: Calibrating reward models with chatbot arena scores

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.716462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.716462Z digest=sha256:533206258dd37de5271d4731d5ebbc3b2673002a5f15d20e27d092ef46b7e925

Observation 8941c8ba-16f9-438b-9dcb-e1edbbcd7d68 · outbound

This paper cites Restoring calibration for aligned large language models: A calibration-aware fine-tuning approach.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Restoring calibration for aligned large language models: A calibration-aware fine-tuning approach

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.719088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.719088Z digest=sha256:98ae23622977906d126db391fdcd497e9be9048fdf4feef67810e9689946f24f

Observation 54a0abea-7d07-4838-bc15-dd125385f050 · outbound

This paper cites Uncertainty estimation in large language models to support biodiversity conservation.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Uncertainty estimation in large language models to support biodiversity conservation

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.321254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.721589Z digest=sha256:d018630f088df5dabc500afaf016b26d6cbf35124fc032a40cb8bf9efd5b93e7

Observation c4da330a-b34e-4de7-b732-7b850c1a77d2 · outbound

This paper cites Evaluating Large Language Models in Theory of Mind Tasks.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Evaluating Large Language Models in Theory of Mind Tasks

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.724363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.724363Z digest=sha256:f35d3157736038ec31b32d46ef77cf75d71b5810e5cd93641faeefa09ea01962

Observation 45e80a02-291f-45f8-af0f-f452ba01f3b9 · outbound

This paper cites Neural theory-of-mind? on the limits of social intelligence in large lms.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Neural theory-of-mind? on the limits of social intelligence in large lms

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.311892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.727107Z digest=sha256:cbfd954bd1cc8d933c26fa1f50f777afa7ae0228778d321b117317a8f7a75976

Observation 3732c923-91aa-4618-9630-d810928a1e8b · outbound

This paper cites Social iqa: Commonsense reasoning about social interactions.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Social iqa: Commonsense reasoning about social interactions

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.303710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.729494Z digest=sha256:abe94abf8461b75e7361b40c53f5f3747c60c9334dc66109b1d535a921087948

Observation f6ae2707-9ad2-4811-ade7-46f523ba93a3 · outbound

This paper cites Large language models are not strong abstract reasoners.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Large language models are not strong abstract reasoners

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.295120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.732181Z digest=sha256:77f00a2667bb7540cae53cf765075e53acc521700eafb779290412f999f1bb6c

Observation 0c5f58cd-35f4-43ac-a61b-3680e204b522 · outbound

This paper cites Coglm: Tracking cognitive development of large language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Coglm: Tracking cognitive development of large language models

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.285900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.734531Z digest=sha256:08f787ac7599c042107ece4aef17aec218eb7709efc2889a39e7e73db850fcec

Observation 51baff84-0779-4c6e-9fb3-16938bc28486 · outbound

This paper cites V-alphasocial: Benchmark and self-reflective chain-of- thought generation for visual social commonsense reasoning.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models V-alphasocial: Benchmark and self-reflective chain-of- thought generation for visual social commonsense reasoning

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.277771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.736943Z digest=sha256:511efe50c41a2d057d2e641d15b9248394e9a543a77645bcd96a988fae1698ab

Observation 627a74e2-98d7-42b2-929e-0df52d2e2100 · outbound

This paper cites Mind2web: Towards a generalist agent for the web.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Mind2web: Towards a generalist agent for the web

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.739479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.739479Z digest=sha256:742fcced577afa74ee7400d7e949a010a3cb38f8e65db82c238413d9c4a03365

Observation 7592be3c-8ba4-4e30-8d6d-1e4ef8e92ddf · outbound

This paper cites Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.742049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.742049Z digest=sha256:2cf50519c4e151757c3c56aa41b8585572936fc0fa9c993bf8c6cd5c4ce45070

Observation 7bed5f91-00c3-4549-b38e-a7350617a961 · outbound

This paper cites Long Range Arena: A Benchmark for Efficient Transformers.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Long Range Arena: A Benchmark for Efficient Transformers

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.745219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.745219Z digest=sha256:b110fe5c344a72fc3eec92b1f23313e78656120637b7804a916a798ac90cddcf

Observation 91e16ef8-01f0-4903-8d7c-ca63f47db4b5 · outbound

This paper cites Minerva: A Programmable Memory Test Benchmark for Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Minerva: A Programmable Memory Test Benchmark for Language Models

Reference 68

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:45:42.847863Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.748430Z digest=sha256:c5a70aa795a510fd71d7dd6903ae7b65a989ecf409af8677b0ab843df3e7ecf3

Observation 0b7abe6e-7add-4c05-9ba7-0a785830c544 · outbound

This paper cites L-eval: Instituting standardized evaluation for long context language models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models L-eval: Instituting standardized evaluation for long context language models

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.264284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.751816Z digest=sha256:0943724ff646e6ad2e1369c50a7b419dc3c630a8d1bdc8676706eaa047ab1546

Observation af100c43-3815-4d90-a3df-597d7498c86d · outbound

This paper cites Needle in the Haystack for Memory Based Large Language Models.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Needle in the Haystack for Memory Based Large Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.754635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.754635Z digest=sha256:52e9c9ef63398f912d48d4e7de6ac867591b7c531fad2f968798cf3776747ae6

Observation a3c961f2-fb53-4177-96d8-a6b899f08052 · outbound

This paper cites Conversational AI Powered by Large Language Models Amplifies False Memories in Witness Interviews.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Conversational AI Powered by Large Language Models Amplifies False Memories in Witness Interviews

Reference 71

Resolution
verified exact
local_arxiv, observed 2026-08-06T14:45:42.825972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.757628Z digest=sha256:24711aae5e2772fb76d756b78cb22ef582eab51a1115d1e9f21bc33269984563

Observation 15d3363f-d81e-4c91-ab3b-69513f717179 · outbound

This paper cites Sentence-bert: Sentence embeddings using siamese bert-networks.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Sentence-bert: Sentence embeddings using siamese bert-networks

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.255832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.760596Z digest=sha256:f5d5c26e98d5366b378f1d3b9ae53e6c66207512f1c527a5af9ac81bbb462a00

Observation e5677550-9e97-4b0e-9fda-11a30c4b5b32 · outbound

This paper cites Introduction to information retrieval , volume 39.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Introduction to information retrieval , volume 39

Reference 73

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.246950Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.763686Z digest=sha256:ac3b9dfbae208f0189bc575d3c7d2ad389e49bb1e30783d52d8ad843d5e9bb63

Observation c7c6cf1c-fa05-4c7a-9208-b05183f4260b · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models The claude 3 model family: Opus, sonnet, haiku

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.237288Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.766616Z digest=sha256:ceec16a9b55a9165676086540328ba26db77504e6ef5168ff6efc683c7d23423

Observation e6138f8e-1207-4806-a43c-7e73eb63aefa · outbound

This paper cites Model card addendum: Claude 3.5 haiku and sonnet.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Model card addendum: Claude 3.5 haiku and sonnet

Reference 75

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.229332Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.769395Z digest=sha256:8217888db9030607310a2fe28bd5ef5c519053a4ba0e6586440df73cf5b16d97

Observation 8918cd5d-be6f-4bd8-b8f9-282fccf6cdc2 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-06T14:45:42.772324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T14:45:42.772324Z digest=sha256:4551f795557a169a860ac4fb834fbc298b2b7695abf7afb9d87170d356e303ca

Observation e4eee62f-382c-4feb-ad6a-30862ead2565 · outbound

This paper cites Introducing meta llama 3.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models Introducing meta llama 3

Reference 77

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.221259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.775275Z digest=sha256:91c0d6fb65c071cde9737080219bb8c0c3a7ebdee1f0366cf349e9f81e7e6832

Observation de7165fe-97ad-4746-84c9-0e7cb86218a3 · outbound

This paper cites The serial position effect of free recall.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models The serial position effect of free recall

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.213126Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.778207Z digest=sha256:8fb48ba30ee8e7096fca673c89e5c3fad403ea2a6426dbd715a169a18f436dcb

Observation 1e0237f2-0b8c-4141-b590-1b0b2faa909c · outbound

This paper cites luck-free.

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models luck-free

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T14:45:43.203784Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T14:45:42.780856Z digest=sha256:4c1bc94687a648c41cda47c9c4bbb348741094cad2dcad8926db07baf31003b2

Pith citing papers

Observation 0c7b0f32-2814-431a-9a24-54afd8f992c0 · inbound

Rethinking Query Optimization for Multi-Agent Systems [Vision] cites this paper.

Rethinking Query Optimization for Multi-Agent Systems [Vision] SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T17:21:27.531024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T17:21:27.531024Z digest=sha256:896833d3d5acc8de6f5e26196b1792f80da79d28060c424726d80a5418ac49e2