Pith. sign in

Paper Citation Record · LEDGER

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.06898.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.06898 v1

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T18:49:33.767557Z

measured 34 of 34 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

34 of 34 outbound references displayed

  • verified exact2
  • verified fuzzy13
  • unresolved17
  • parse uncertain0
  • malformed identifier2
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation debef129-e044-475a-8ff3-41abe7157c3a · outbound

This paper cites Large language models for human–robot interaction: A review,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Large language models for human–robot interaction: A review,

Reference 1

Resolution
malformed identifier
no resolver link, observed 2026-08-10T18:49:33.641836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.641836Z digest=sha256:63c58d57a38e26eca41f745fc14de9cc1c3ea7293f7af54b9c7c0b1daed8534f

Observation e0fb45db-4667-4dba-bb35-7de75cc2dc95 · outbound

This paper cites Between reality and delusion: Challenges of applying large language models to companion robots for open-domain dialogues with older adults,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Between reality and delusion: Challenges of applying large language models to companion robots for open-domain dialogues with older adults,

Reference 2

Resolution
verified exact
doi, observed 2026-08-10T18:49:33.822598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.646017Z digest=sha256:b60aa4ee90e0ab36c687c4ce61cd207e80bf4a93d0b833c6a832506627259c70

Observation a21ba231-7fdb-492f-b34b-1f392d39ae12 · outbound

This paper cites Robot-led vision language model wellbeing assessment of children,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Robot-led vision language model wellbeing assessment of children,

Reference 3

Resolution
malformed identifier
no resolver link, observed 2026-08-10T18:49:33.649984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.649984Z digest=sha256:59ad5f5e5ba9735390142c2a8ec266a56b838c60350f450abec0a3ac3d92f864

Observation 4d87ac93-8110-4f52-844d-57840c828cd7 · outbound

This paper cites Ain’t misbehavin’ – using LLMs to generate expressive robot behavior in conversations with the tabletop robot haru,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Ain’t misbehavin’ – using LLMs to generate expressive robot behavior in conversations with the tabletop robot haru,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.654894Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.654894Z digest=sha256:0ef4747c12a5c6f4acb7d7b4fc22827be1868182df021b399b8ac122e7a82f7f

Observation b852875c-0b83-4800-90ce-59b8098fd3e5 · outbound

This paper cites Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.659051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.659051Z digest=sha256:fe6e86f826b68ad9857e4e5f1d91f4d0b19de4f364b5938cdd94e75b1ce2abe1

Observation e547bb49-8e7d-43c9-9ad6-47be77495325 · outbound

This paper cites LiveBench: A challenging, contamination-limited LLM benchmark,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots LiveBench: A challenging, contamination-limited LLM benchmark,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.453224Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.662972Z digest=sha256:828c9ee0932892ea7786e6ec12d24dbbfc282c909a5c56a6ed6d7553d7a38582

Observation c6cd0c5f-cb89-4460-a01a-5c2774242c25 · outbound

This paper cites A simplest systematics for the organization of turn-taking for conversation,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots A simplest systematics for the organization of turn-taking for conversation,

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.670510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.670510Z digest=sha256:de10d4abf4f4c5d8b14e4868577b10cd35cc133d13a329c26401797601365285

Observation f7517616-d0e7-4470-9d36-b90c13624566 · outbound

This paper cites Universals and cultural variation in turn-taking in conversation,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Universals and cultural variation in turn-taking in conversation,

Reference 8

Resolution
verified exact
doi, observed 2026-08-10T18:49:33.803245Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.674335Z digest=sha256:6d33cbd5c254ee0e71b80db7ae6dcb4482a8b85cecbe4d55b3c839fbe7220922

Observation 896e3d4c-5d5a-44ea-92a3-23d3c3442392 · outbound

This paper cites SOTOPIA: Interactive evaluation for social intelligence in language agents,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots SOTOPIA: Interactive evaluation for social intelligence in language agents,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.440755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.677677Z digest=sha256:3c690762ad6c82d38e3b47e0e2942ccfe890b0f064189e7163c2aa64b2c9d543

Observation 732a799b-6871-40fa-9739-0f134cddddc3 · outbound

This paper cites RoboArena: Distributed real- world evaluation of generalist robot policies,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots RoboArena: Distributed real- world evaluation of generalist robot policies,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.681339Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.681339Z digest=sha256:b7fcea49cc7cd884a36a4d431002683af3b6798691912e23511f17a203a5aeb0

Observation 42f0174f-91f1-4bb8-a7cc-19d74b6b89fa · outbound

This paper cites Desiderata for foundation models in social robots: Capturing embodied and social aspects for benchmarking,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Desiderata for foundation models in social robots: Capturing embodied and social aspects for benchmarking,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.430410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.684948Z digest=sha256:b0fd270ef7838f1fa950eaf1b5e01283bf6662affc27338b3e0af22014a1aff9

Observation 0782ac6f-a24d-405b-ba40-d83478fad4fc · outbound

This paper cites Holistic Evaluation of Language Models.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Holistic Evaluation of Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.689081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.689081Z digest=sha256:6c92f39ab77c75227965e532e4398ef83372f643e8255d22b0b8c131a68be7d4

Observation 240c7e2c-9f47-41ca-9076-48968dbb177c · outbound

This paper cites Towards pareto optimal throughput in small language model serving,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Towards pareto optimal throughput in small language model serving,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.692874Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.692874Z digest=sha256:333f7779bfb2f2d11cf40970bad5f5fb4170134806db914a602d93fdfcc12411

Observation b0f1e248-f316-4718-b344-e9ec334a5c78 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Measuring Massive Multitask Language Understanding

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.696450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.696450Z digest=sha256:4bd86c25896ae8b6bc7ec00df9b081bc4a1ba462bd1d95025f76c6560e29f2f8

Observation 9e38eb0b-0796-4063-a968-0dc662381298 · outbound

This paper cites CommonsenseQA: A question answering challenge targeting commonsense knowledge,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots CommonsenseQA: A question answering challenge targeting commonsense knowledge,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.419771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.700505Z digest=sha256:d0ed2aa07852f217f20da63e6cfa32067d77edbd144a8eda5e88ca86015d1140

Observation f5667419-c1a7-416b-b67e-83d2089b92ae · outbound

This paper cites HellaSwag: Can a machine really finish your sentence?.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots HellaSwag: Can a machine really finish your sentence?

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.408626Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.703828Z digest=sha256:dd6e016a1c6b3ddd69958b5c2c19be579aa320305ffa18936af9e727ee6a78db

Observation 2741cf05-b9e3-4598-8d78-0fab0b8e32fe · outbound

This paper cites Social IQa: Commonsense reasoning about social interactions,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Social IQa: Commonsense reasoning about social interactions,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.397076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.707899Z digest=sha256:968065e842bc4f9f26c40021478741e3308d22e5fcc5cacd68f01db1f77aa77a

Observation 0194d405-f1e2-4516-9439-60547a4c7eac · outbound

This paper cites TruthfulQA: Measuring how models mimic human falsehoods,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots TruthfulQA: Measuring how models mimic human falsehoods,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.385803Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.711267Z digest=sha256:df8ede8835af6eea331abf33f1205636394985e14ec591686b954df93412da3a

Observation 1dec115a-a677-4ce6-80d0-d6eda0fbf033 · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Instruction-Following Evaluation for Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.715280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.715280Z digest=sha256:0d8c06206f6705ab80875f6f963a742c588129d2a9cd984ff774272affbf5983

Observation 62421912-0b83-4495-8901-40d88927db93 · outbound

This paper cites XSTest: A test suite for identifying exaggerated safety behaviours in large language models,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots XSTest: A test suite for identifying exaggerated safety behaviours in large language models,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.374000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.719627Z digest=sha256:3617d2bcdedf039b59478f0344bb07cfa9d679612b64bb970ab5ce827c924076

Observation c4e08202-2970-4b86-b433-629d5dcce9ea · outbound

This paper cites OR-Bench: An Over-Refusal Benchmark for Large Language Models.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.723144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.723144Z digest=sha256:6e5d84cb8fc7ee1a989bb9bbf9586095e207e7373f59133d07546742e4aabae9

Observation 3cd3728b-5659-41ec-a636-1bafc436d152 · outbound

This paper cites Challenging BIG-Bench tasks and whether chain-of-thought can solve them,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Challenging BIG-Bench tasks and whether chain-of-thought can solve them,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.360611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.726833Z digest=sha256:42ac4963884e56fdb4afa203c73b04d0d585315d714169f6e87a1d565c8abcd3

Observation 635864b8-ee5f-4aca-8b82-ae6fa40ec123 · outbound

This paper cites The language model evaluation harness,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots The language model evaluation harness,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.348455Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.730657Z digest=sha256:eba7075cbdff43de9a4ba99ebfc8a25c058f636de73b2e026102696b96ced1f2

Observation aedfb312-9795-453d-b579-b43fa9def55a · outbound

This paper cites Efficient memory management for large language model serving with PagedAttention,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Efficient memory management for large language model serving with PagedAttention,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.734350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.734350Z digest=sha256:4c0d6e05a4e3e7bb147153199339aa583e726eafb58a46a80105659a86345de9

Observation 7a7d6c67-1b12-4499-90e4-bbc139fb9b23 · outbound

This paper cites EmoAgent: Assessing and safeguarding human-AI interaction for mental health safety,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots EmoAgent: Assessing and safeguarding human-AI interaction for mental health safety,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.336843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.737791Z digest=sha256:88a7877bf600c222760d5211587590db4dac307608c4fad5df1943f4f1a18c65

Observation f2d12f79-5bee-42f4-a926-60e38daa0f2d · outbound

This paper cites A Survey on LLM-as-a-Judge.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots A Survey on LLM-as-a-Judge

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.741628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.741628Z digest=sha256:5758c2825304cbc0d4846d2b5399055eb66b923fcf26fdf258d923fc1d992ce6

Observation d5be88a9-3b2f-4030-b391-1b79c077f53e · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.745129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.745129Z digest=sha256:14575e6e79548af920c06164b719c946b59dd6efdf4917e041196a997fc30e65

Observation a44e26ce-08da-4d10-b301-1902bdd00d2d · outbound

This paper cites AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.748697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.748697Z digest=sha256:27b565793f96c17c89479f4118b9e4d32f835402529824794c530d791cc4f58d

Observation cd22fc60-e8f5-41b9-bc8b-e5b15b8026e2 · outbound

This paper cites LLM Evaluators Recognize and Favor Their Own Generations.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots LLM Evaluators Recognize and Favor Their Own Generations

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.752633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.752633Z digest=sha256:72c6e2e5a0b4e75cb588ca4d652b449f3862814ac98bebad36dc4195c209ddda

Observation 3817a332-e55a-475e-be00-4ec70d608c40 · outbound

This paper cites Is this the real life? is this just fantasy? the misleading success of simulating social interactions with LLMs,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Is this the real life? is this just fantasy? the misleading success of simulating social interactions with LLMs,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.324013Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.757514Z digest=sha256:9790fd0a6d77c2bbc349dcdc2138fda560214cf9c7877e9439d4cbc8a668cbea

Observation f1b7957b-0e70-4052-a31d-9bce558076c0 · outbound

This paper cites SOTOPIA-π: Interactive learning of socially intelligent language agents,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots SOTOPIA-π: Interactive learning of socially intelligent language agents,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T18:49:34.311853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T18:49:33.761015Z digest=sha256:35ff0d0922b8ce6aefc90c38d18b65c5033f018aa47ccb2421aee504e493befd

Observation e4220c41-695d-44c5-8e8c-4e58cfdb27e0 · outbound

This paper cites Haru: Hardware design of an experimental tabletop robot assistant,.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots Haru: Hardware design of an experimental tabletop robot assistant,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.764374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.764374Z digest=sha256:d0bacbe5a4fc1d48d9f7092a3f905f89acbc7af7990831004586f84b9213ebd2

Observation a06a3084-6a48-43ef-ac07-ca6d4b9cec1b · outbound

This paper cites BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.767557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.767557Z digest=sha256:76816da900be9b7c5d99bf9a0cf1ec5b6dfee5f5041a265ca2c7c3f6a989ec0d

Observation 4fba2ce8-f8cb-485e-abea-b0c421c4bd37 · outbound

This paper cites LiveBench: A Challenging, Contamination-Limited LLM Benchmark.

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots LiveBench: A Challenging, Contamination-Limited LLM Benchmark

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-10T18:49:33.666532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T18:49:33.666532Z digest=sha256:3feb0fbb17ed897d749f910fd2fcc13e17947107d2231c3489884cfd573655a8

Pith citing papers

No inbound Pith citation observations are available.