Pith. sign in

Paper Citation Record · LEDGER

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

As of 22 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.06898.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.06898 v1

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T18:49:33.767557Z

measured 34 of 34 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

34 of 34 outbound references displayed

  • verified exact2
  • verified fuzzy13
  • unresolved17
  • parse uncertain0
  • malformed identifier2
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation debef129-e044-475a-8ff3-41abe7157c3a · outbound

This paper cites Large language models for human–robot interaction: A review,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Large language models for human–robot interaction: A review,

Reference 1

Resolution
malformed identifier
no resolver link, observed 2026-08-10T18:49:33.641836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.641836Z digest=sha256:63c58d57a38e26eca41f745fc14de9cc1c3ea7293f7af54b9c7c0b1daed8534f

Observation e0fb45db-4667-4dba-bb35-7de75cc2dc95 · outbound

This paper cites Between reality and delusion: Challenges of applying large language models to companion robots for open-domain dialogues with older adults,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Between reality and delusion: Challenges of applying large language models to companion robots for open-domain dialogues with older adults,

Reference 2

Resolution
verified exact
doi, observed 2026-08-10T18:49:33.822598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.646017Z digest=sha256:7dfd99347580aaef1cd1008b1df7ddf833d89d13f8064f4548a8525ecc766b00

Observation a21ba231-7fdb-492f-b34b-1f392d39ae12 · outbound

This paper cites Robot-led vision language model wellbeing assessment of children,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Robot-led vision language model wellbeing assessment of children,

Reference 3

Resolution
malformed identifier
no resolver link, observed 2026-08-10T18:49:33.649984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.649984Z digest=sha256:59ad5f5e5ba9735390142c2a8ec266a56b838c60350f450abec0a3ac3d92f864

Observation 4d87ac93-8110-4f52-844d-57840c828cd7 · outbound

This paper cites Ain’t misbehavin’ – using LLMs to generate expressive robot behavior in conversations with the tabletop robot haru,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Ain’t misbehavin’ – using LLMs to generate expressive robot behavior in conversations with the tabletop robot haru,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.654894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.654894Z digest=sha256:0ef4747c12a5c6f4acb7d7b4fc22827be1868182df021b399b8ac122e7a82f7f

Observation b852875c-0b83-4800-90ce-59b8098fd3e5 · outbound

This paper cites Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.659051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.659051Z digest=sha256:fe6e86f826b68ad9857e4e5f1d91f4d0b19de4f364b5938cdd94e75b1ce2abe1

Observation e547bb49-8e7d-43c9-9ad6-47be77495325 · outbound

This paper cites LiveBench: A challenging, contamination-limited LLM benchmark,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots LiveBench: A challenging, contamination-limited LLM benchmark,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.453224Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.662972Z digest=sha256:80983408139317840508361216e34ce7b99791fa9ce6e0fa868c26145b42c9b1

Observation c6cd0c5f-cb89-4460-a01a-5c2774242c25 · outbound

This paper cites A simplest systematics for the organization of turn-taking for conversation,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots A simplest systematics for the organization of turn-taking for conversation,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.670510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.670510Z digest=sha256:de10d4abf4f4c5d8b14e4868577b10cd35cc133d13a329c26401797601365285

Observation f7517616-d0e7-4470-9d36-b90c13624566 · outbound

This paper cites Universals and cultural variation in turn-taking in conversation,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Universals and cultural variation in turn-taking in conversation,

Reference 8

Resolution
verified exact
doi, observed 2026-08-10T18:49:33.803245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.674335Z digest=sha256:66053ded088b84cd3e02cc5a6a2c36795b26fe7e4fc42723c97c9d04b666dd72

Observation 896e3d4c-5d5a-44ea-92a3-23d3c3442392 · outbound

This paper cites SOTOPIA: Interactive evaluation for social intelligence in language agents,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots SOTOPIA: Interactive evaluation for social intelligence in language agents,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.440755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.677677Z digest=sha256:40f0fae5850696b92f7400d758903128c4e3e472e1757936d259c66912e89dcb

Observation 732a799b-6871-40fa-9739-0f134cddddc3 · outbound

This paper cites RoboArena: Distributed real- world evaluation of generalist robot policies,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots RoboArena: Distributed real- world evaluation of generalist robot policies,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.681339Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.681339Z digest=sha256:b7fcea49cc7cd884a36a4d431002683af3b6798691912e23511f17a203a5aeb0

Observation 42f0174f-91f1-4bb8-a7cc-19d74b6b89fa · outbound

This paper cites Desiderata for foundation models in social robots: Capturing embodied and social aspects for benchmarking,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Desiderata for foundation models in social robots: Capturing embodied and social aspects for benchmarking,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.430410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.684948Z digest=sha256:92d31a32d6836d319fd59ede6434530b878996387864d8b78b08457efdb10bea

Observation 0782ac6f-a24d-405b-ba40-d83478fad4fc · outbound

This paper cites Holistic Evaluation of Language Models.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Holistic Evaluation of Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.689081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.689081Z digest=sha256:6c92f39ab77c75227965e532e4398ef83372f643e8255d22b0b8c131a68be7d4

Observation 240c7e2c-9f47-41ca-9076-48968dbb177c · outbound

This paper cites Towards pareto optimal throughput in small language model serving,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Towards pareto optimal throughput in small language model serving,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.692874Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.692874Z digest=sha256:333f7779bfb2f2d11cf40970bad5f5fb4170134806db914a602d93fdfcc12411

Observation b0f1e248-f316-4718-b344-e9ec334a5c78 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Measuring Massive Multitask Language Understanding

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.696450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.696450Z digest=sha256:4bd86c25896ae8b6bc7ec00df9b081bc4a1ba462bd1d95025f76c6560e29f2f8

Observation 9e38eb0b-0796-4063-a968-0dc662381298 · outbound

This paper cites CommonsenseQA: A question answering challenge targeting commonsense knowledge,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots CommonsenseQA: A question answering challenge targeting commonsense knowledge,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.419771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.700505Z digest=sha256:3ae80f84d36c412b20d763812f779c0a45bc83644480c4e7b9f841faf5b5722a

Observation f5667419-c1a7-416b-b67e-83d2089b92ae · outbound

This paper cites HellaSwag: Can a machine really finish your sentence?.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots HellaSwag: Can a machine really finish your sentence?

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.408626Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.703828Z digest=sha256:98208f555ce7e83da7a6542e50ca84081d9f3698e1ede19320a3ee91e2627643

Observation 2741cf05-b9e3-4598-8d78-0fab0b8e32fe · outbound

This paper cites Social IQa: Commonsense reasoning about social interactions,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Social IQa: Commonsense reasoning about social interactions,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.397076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.707899Z digest=sha256:2e6edcd17989094f8e3bd5ead309d61db90775ef4f6af9cdce3a27780304714e

Observation 0194d405-f1e2-4516-9439-60547a4c7eac · outbound

This paper cites TruthfulQA: Measuring how models mimic human falsehoods,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots TruthfulQA: Measuring how models mimic human falsehoods,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.385803Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.711267Z digest=sha256:04e0eb39b3cca8de699f28912513de5b2f915f3515c909483329e2e495e0a735

Observation 1dec115a-a677-4ce6-80d0-d6eda0fbf033 · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Instruction-Following Evaluation for Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.715280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.715280Z digest=sha256:0d8c06206f6705ab80875f6f963a742c588129d2a9cd984ff774272affbf5983

Observation 62421912-0b83-4495-8901-40d88927db93 · outbound

This paper cites XSTest: A test suite for identifying exaggerated safety behaviours in large language models,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots XSTest: A test suite for identifying exaggerated safety behaviours in large language models,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.374000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.719627Z digest=sha256:e6997c8d02f280234eb965db51c021e1786ee59934a6a35f0c2f035ad82bc1b9

Observation c4e08202-2970-4b86-b433-629d5dcce9ea · outbound

This paper cites OR-Bench: An Over-Refusal Benchmark for Large Language Models.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.723144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.723144Z digest=sha256:6e5d84cb8fc7ee1a989bb9bbf9586095e207e7373f59133d07546742e4aabae9

Observation 3cd3728b-5659-41ec-a636-1bafc436d152 · outbound

This paper cites Challenging BIG-Bench tasks and whether chain-of-thought can solve them,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Challenging BIG-Bench tasks and whether chain-of-thought can solve them,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.360611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.726833Z digest=sha256:4d5ce735ee409593b01665f53b83703694ea1734c920d2984d4b31b5315de922

Observation 635864b8-ee5f-4aca-8b82-ae6fa40ec123 · outbound

This paper cites The language model evaluation harness,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots The language model evaluation harness,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.348455Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.730657Z digest=sha256:8c3386eb5ac338e10003253f81974bcfc31ec55f6957e8a95158ca361ddffb2f

Observation aedfb312-9795-453d-b579-b43fa9def55a · outbound

This paper cites Efficient memory management for large language model serving with PagedAttention,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Efficient memory management for large language model serving with PagedAttention,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.734350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.734350Z digest=sha256:4c0d6e05a4e3e7bb147153199339aa583e726eafb58a46a80105659a86345de9

Observation 7a7d6c67-1b12-4499-90e4-bbc139fb9b23 · outbound

This paper cites EmoAgent: Assessing and safeguarding human-AI interaction for mental health safety,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots EmoAgent: Assessing and safeguarding human-AI interaction for mental health safety,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.336843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.737791Z digest=sha256:6523d576ccd97215b1072fc8221f0eaacf3ecee5bb07aebdf99fdc4d488ae985

Observation f2d12f79-5bee-42f4-a926-60e38daa0f2d · outbound

This paper cites A Survey on LLM-as-a-Judge.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots A Survey on LLM-as-a-Judge

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.741628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.741628Z digest=sha256:5758c2825304cbc0d4846d2b5399055eb66b923fcf26fdf258d923fc1d992ce6

Observation d5be88a9-3b2f-4030-b391-1b79c077f53e · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.745129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.745129Z digest=sha256:14575e6e79548af920c06164b719c946b59dd6efdf4917e041196a997fc30e65

Observation a44e26ce-08da-4d10-b301-1902bdd00d2d · outbound

This paper cites AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.748697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.748697Z digest=sha256:27b565793f96c17c89479f4118b9e4d32f835402529824794c530d791cc4f58d

Observation cd22fc60-e8f5-41b9-bc8b-e5b15b8026e2 · outbound

This paper cites LLM Evaluators Recognize and Favor Their Own Generations.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots LLM Evaluators Recognize and Favor Their Own Generations

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.752633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.752633Z digest=sha256:72c6e2e5a0b4e75cb588ca4d652b449f3862814ac98bebad36dc4195c209ddda

Observation 3817a332-e55a-475e-be00-4ec70d608c40 · outbound

This paper cites Is this the real life? is this just fantasy? the misleading success of simulating social interactions with LLMs,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Is this the real life? is this just fantasy? the misleading success of simulating social interactions with LLMs,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.324013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.757514Z digest=sha256:533911f9e4bfb147090b2da6502d38cab7fbd84326d813b0300952307ae7ba26

Observation f1b7957b-0e70-4052-a31d-9bce558076c0 · outbound

This paper cites SOTOPIA-π: Interactive learning of socially intelligent language agents,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots SOTOPIA-π: Interactive learning of socially intelligent language agents,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.311853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-10T18:49:33.761015Z digest=sha256:83a2654361f114fc01f800272876d730ea000b4d088239bee5df02cf30d96d6a

Observation e4220c41-695d-44c5-8e8c-4e58cfdb27e0 · outbound

This paper cites Haru: Hardware design of an experimental tabletop robot assistant,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Haru: Hardware design of an experimental tabletop robot assistant,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.764374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.764374Z digest=sha256:d0bacbe5a4fc1d48d9f7092a3f905f89acbc7af7990831004586f84b9213ebd2

Observation a06a3084-6a48-43ef-ac07-ca6d4b9cec1b · outbound

This paper cites BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.767557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.767557Z digest=sha256:76816da900be9b7c5d99bf9a0cf1ec5b6dfee5f5041a265ca2c7c3f6a989ec0d

Observation 4fba2ce8-f8cb-485e-abea-b0c421c4bd37 · outbound

This paper cites LiveBench: A Challenging, Contamination-Limited LLM Benchmark.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots LiveBench: A Challenging, Contamination-Limited LLM Benchmark

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.666532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.666532Z digest=sha256:3feb0fbb17ed897d749f910fd2fcc13e17947107d2231c3489884cfd573655a8

Pith citing papers

No inbound Pith citation observations are available.