{"as_of":"2026-08-22T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13bcf3d6401343f36095292ef35f2f41454cfab54eedf39b1390a0dd94afec5a","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:49:33.767557Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06898/citation-record","integrity":"/paper/2608.06898/integrity","json":"/paper/2608.06898/citation-record.json","paper":"/paper/2608.06898"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.641836Z","title":"Large language models for human–robot interaction: A review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.641836Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:63c58d57a38e26eca41f745fc14de9cc1c3ea7293f7af54b9c7c0b1daed8534f","observation_id":"debef129-e044-475a-8ff3-41abe7157c3a","resolution":{"observed_at":"2026-08-10T18:49:33.641836Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10514-025-10190-y","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-19T11:03:45.297681Z","title":"Between reality and delusion: Challenges of applying large language models to companion robots for open-domain dialogues with older adults,","venue":"Autonomous Robots","work_id":"00aed932-2904-40f0-997a-1510f5e99efe","year":2025},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.646017Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:b60aa4ee90e0ab36c687c4ce61cd207e80bf4a93d0b833c6a832506627259c70","observation_id":"e0fb45db-4667-4dba-bb35-7de75cc2dc95","resolution":{"observed_at":"2026-08-10T18:49:33.822598Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.649984Z","title":"Robot-led vision language model wellbeing assessment of children,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.649984Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:59ad5f5e5ba9735390142c2a8ec266a56b838c60350f450abec0a3ac3d92f864","observation_id":"a21ba231-7fdb-492f-b34b-1f392d39ae12","resolution":{"observed_at":"2026-08-10T18:49:33.649984Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.654894Z","title":"Ain’t misbehavin’ – using LLMs to generate expressive robot behavior in conversations with the tabletop robot haru,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.654894Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:0ef4747c12a5c6f4acb7d7b4fc22827be1868182df021b399b8ac122e7a82f7f","observation_id":"4d87ac93-8110-4f52-844d-57840c828cd7","resolution":{"observed_at":"2026-08-10T18:49:33.654894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-10T18:49:33.659051Z","title":"Chatbot arena: An open platform for evaluating LLMs by human preference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.659051Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:fe6e86f826b68ad9857e4e5f1d91f4d0b19de4f364b5938cdd94e75b1ce2abe1","observation_id":"b852875c-0b83-4800-90ce-59b8098fd3e5","resolution":{"observed_at":"2026-08-10T18:49:33.659051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.448160Z","title":"LiveBench: A challenging, contamination-limited LLM benchmark,","venue":null,"work_id":"9e1a7400-83e1-4945-b2af-71d17e90fa9e","year":null},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.662972Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:828c9ee0932892ea7786e6ec12d24dbbfc282c909a5c56a6ed6d7553d7a38582","observation_id":"e547bb49-8e7d-43c9-9ad6-47be77495325","resolution":{"observed_at":"2026-08-10T18:49:34.453224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.670510Z","title":"A simplest systematics for the organization of turn-taking for conversation,","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.670510Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:de10d4abf4f4c5d8b14e4868577b10cd35cc133d13a329c26401797601365285","observation_id":"c6cd0c5f-cb89-4460-a01a-5c2774242c25","resolution":{"observed_at":"2026-08-10T18:49:33.670510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.797640Z","title":"Universals and cultural variation in turn-taking in conversation,","venue":null,"work_id":"2a1dcb67-f55c-4a35-aeb8-181b9b2d3509","year":2009},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.674335Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:6d33cbd5c254ee0e71b80db7ae6dcb4482a8b85cecbe4d55b3c839fbe7220922","observation_id":"f7517616-d0e7-4470-9d36-b90c13624566","resolution":{"observed_at":"2026-08-10T18:49:33.803245Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.437056Z","title":"SOTOPIA: Interactive evaluation for social intelligence in language agents,","venue":null,"work_id":"4defb152-6e33-4af5-855d-88cd47af5ccc","year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.677677Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:3c690762ad6c82d38e3b47e0e2942ccfe890b0f064189e7163c2aa64b2c9d543","observation_id":"896e3d4c-5d5a-44ea-92a3-23d3c3442392","resolution":{"observed_at":"2026-08-10T18:49:34.440755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.681339Z","title":"RoboArena: Distributed real- world evaluation of generalist robot policies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.681339Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:b7fcea49cc7cd884a36a4d431002683af3b6798691912e23511f17a203a5aeb0","observation_id":"732a799b-6871-40fa-9739-0f134cddddc3","resolution":{"observed_at":"2026-08-10T18:49:33.681339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.426698Z","title":"Desiderata for foundation models in social robots: Capturing embodied and social aspects for benchmarking,","venue":null,"work_id":"4d0f70b7-c329-4584-a3fa-252629a54af0","year":2026},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.684948Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:b0fd270ef7838f1fa950eaf1b5e01283bf6662affc27338b3e0af22014a1aff9","observation_id":"42f0174f-91f1-4bb8-a7cc-19d74b6b89fa","resolution":{"observed_at":"2026-08-10T18:49:34.430410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T18:49:33.689081Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.689081Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:6c92f39ab77c75227965e532e4398ef83372f643e8255d22b0b8c131a68be7d4","observation_id":"0782ac6f-a24d-405b-ba40-d83478fad4fc","resolution":{"observed_at":"2026-08-10T18:49:33.689081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.692874Z","title":"Towards pareto optimal throughput in small language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.692874Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:333f7779bfb2f2d11cf40970bad5f5fb4170134806db914a602d93fdfcc12411","observation_id":"240c7e2c-9f47-41ca-9076-48968dbb177c","resolution":{"observed_at":"2026-08-10T18:49:33.692874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T18:49:33.696450Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.696450Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:4bd86c25896ae8b6bc7ec00df9b081bc4a1ba462bd1d95025f76c6560e29f2f8","observation_id":"b0f1e248-f316-4718-b344-e9ec334a5c78","resolution":{"observed_at":"2026-08-10T18:49:33.696450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.416035Z","title":"CommonsenseQA: A question answering challenge targeting commonsense knowledge,","venue":null,"work_id":"4fbd4fe3-f066-45e5-9eb1-160035c2f1c6","year":2019},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.700505Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:d0ed2aa07852f217f20da63e6cfa32067d77edbd144a8eda5e88ca86015d1140","observation_id":"9e38eb0b-0796-4063-a968-0dc662381298","resolution":{"observed_at":"2026-08-10T18:49:34.419771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.405133Z","title":"HellaSwag: Can a machine really finish your sentence?","venue":null,"work_id":"9c03545f-c518-48eb-8b3f-82ec27bc70c9","year":2019},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.703828Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:dd6e016a1c6b3ddd69958b5c2c19be579aa320305ffa18936af9e727ee6a78db","observation_id":"f5667419-c1a7-416b-b67e-83d2089b92ae","resolution":{"observed_at":"2026-08-10T18:49:34.408626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.393093Z","title":"Social IQa: Commonsense reasoning about social interactions,","venue":null,"work_id":"05331412-4900-42aa-8c0f-77fb17cc2ed5","year":2019},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.707899Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:968065e842bc4f9f26c40021478741e3308d22e5fcc5cacd68f01db1f77aa77a","observation_id":"2741cf05-b9e3-4598-8d78-0fab0b8e32fe","resolution":{"observed_at":"2026-08-10T18:49:34.397076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.381960Z","title":"TruthfulQA: Measuring how models mimic human falsehoods,","venue":null,"work_id":"da0b01f7-7f83-49a8-b3b6-15b7fc37f623","year":2022},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.711267Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:df8ede8835af6eea331abf33f1205636394985e14ec591686b954df93412da3a","observation_id":"0194d405-f1e2-4516-9439-60547a4c7eac","resolution":{"observed_at":"2026-08-10T18:49:34.385803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-10T18:49:33.715280Z","title":"Instruction-following evaluation for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.715280Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:0d8c06206f6705ab80875f6f963a742c588129d2a9cd984ff774272affbf5983","observation_id":"1dec115a-a677-4ce6-80d0-d6eda0fbf033","resolution":{"observed_at":"2026-08-10T18:49:33.715280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.368663Z","title":"XSTest: A test suite for identifying exaggerated safety behaviours in large language models,","venue":null,"work_id":"7209b723-4f01-425c-a592-695fc3970609","year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.719627Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:3617d2bcdedf039b59478f0344bb07cfa9d679612b64bb970ab5ce827c924076","observation_id":"62421912-0b83-4495-8901-40d88927db93","resolution":{"observed_at":"2026-08-10T18:49:34.374000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20947","last_updated":"2025-06-15T21:44:25Z","snapshot_observed_at":"2026-08-19T07:28:13.224791Z","submitted_at":"2024-05-31T15:44:33Z","title":"OR-Bench: An Over-Refusal Benchmark for Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20947","snapshot_observed_at":"2026-08-10T18:49:33.723144Z","title":"OR-Bench: An over-refusal benchmark for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.723144Z"},"links":{"cited_paper":"/paper/2405.20947","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:6e5d84cb8fc7ee1a989bb9bbf9586095e207e7373f59133d07546742e4aabae9","observation_id":"c4e08202-2970-4b86-b433-629d5dcce9ea","resolution":{"observed_at":"2026-08-10T18:49:33.723144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.356650Z","title":"Challenging BIG-Bench tasks and whether chain-of-thought can solve them,","venue":null,"work_id":"fb286b06-7dc5-4395-8368-304bb98ff63b","year":2023},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.726833Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:42ac4963884e56fdb4afa203c73b04d0d585315d714169f6e87a1d565c8abcd3","observation_id":"3cd3728b-5659-41ec-a636-1bafc436d152","resolution":{"observed_at":"2026-08-10T18:49:34.360611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.344413Z","title":"The language model evaluation harness,","venue":null,"work_id":"8bb5fc6b-6281-4f06-8dd5-12dcddd979ac","year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.730657Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:eba7075cbdff43de9a4ba99ebfc8a25c058f636de73b2e026102696b96ced1f2","observation_id":"635864b8-ee5f-4aca-8b82-ae6fa40ec123","resolution":{"observed_at":"2026-08-10T18:49:34.348455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.734350Z","title":"Efficient memory management for large language model serving with PagedAttention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.734350Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:4c0d6e05a4e3e7bb147153199339aa583e726eafb58a46a80105659a86345de9","observation_id":"aedfb312-9795-453d-b579-b43fa9def55a","resolution":{"observed_at":"2026-08-10T18:49:33.734350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.331659Z","title":"EmoAgent: Assessing and safeguarding human-AI interaction for mental health safety,","venue":null,"work_id":"069776ee-a4ee-47c6-a81c-43260f78513e","year":2025},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.737791Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:88a7877bf600c222760d5211587590db4dac307608c4fad5df1943f4f1a18c65","observation_id":"7a7d6c67-1b12-4499-90e4-bbc139fb9b23","resolution":{"observed_at":"2026-08-10T18:49:34.336843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-20T12:52:29.141935Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-10T18:49:33.741628Z","title":"A survey on LLM-as-a-judge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.741628Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:5758c2825304cbc0d4846d2b5399055eb66b923fcf26fdf258d923fc1d992ce6","observation_id":"f2d12f79-5bee-42f4-a926-60e38daa0f2d","resolution":{"observed_at":"2026-08-10T18:49:33.741628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-10T18:49:33.745129Z","title":"Judging LLM-as-a-judge with MT-Bench and Chatbot Arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.745129Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:14575e6e79548af920c06164b719c946b59dd6efdf4917e041196a997fc30e65","observation_id":"d5be88a9-3b2f-4030-b391-1b79c077f53e","resolution":{"observed_at":"2026-08-10T18:49:33.745129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05088","last_updated":"2026-07-07T19:40:51Z","snapshot_observed_at":"2026-08-19T17:36:06.822243Z","submitted_at":"2026-02-04T22:17:04Z","title":"AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05088","snapshot_observed_at":"2026-08-10T18:49:33.748697Z","title":"VERA-MH: Reliability and validity of an open-source AI safety evaluation in mental health,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.748697Z"},"links":{"cited_paper":"/paper/2602.05088","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:27b565793f96c17c89479f4118b9e4d32f835402529824794c530d791cc4f58d","observation_id":"a44e26ce-08da-4d10-b301-1902bdd00d2d","resolution":{"observed_at":"2026-08-10T18:49:33.748697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-18T02:44:37.072871Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-10T18:49:33.752633Z","title":"LLM evaluators recognize and favor their own generations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.752633Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:72c6e2e5a0b4e75cb588ca4d652b449f3862814ac98bebad36dc4195c209ddda","observation_id":"cd22fc60-e8f5-41b9-bc8b-e5b15b8026e2","resolution":{"observed_at":"2026-08-10T18:49:33.752633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.319580Z","title":"Is this the real life? is this just fantasy? the misleading success of simulating social interactions with LLMs,","venue":null,"work_id":"87758d7d-f5ae-4485-8831-122d45d55f3b","year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.757514Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:9790fd0a6d77c2bbc349dcdc2138fda560214cf9c7877e9439d4cbc8a668cbea","observation_id":"3817a332-e55a-475e-be00-4ec70d608c40","resolution":{"observed_at":"2026-08-10T18:49:34.324013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:34.308096Z","title":"SOTOPIA-π: Interactive learning of socially intelligent language agents,","venue":null,"work_id":"b79df368-057d-411a-a912-7e6bf6b3b012","year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.761015Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:35ff0d0922b8ce6aefc90c38d18b65c5033f018aa47ccb2421aee504e493befd","observation_id":"f1b7957b-0e70-4052-a31d-9bce558076c0","resolution":{"observed_at":"2026-08-10T18:49:34.311853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:49:33.764374Z","title":"Haru: Hardware design of an experimental tabletop robot assistant,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.764374Z"},"links":{"citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:d0bacbe5a4fc1d48d9f7092a3f905f89acbc7af7990831004586f84b9213ebd2","observation_id":"e4220c41-695d-44c5-8e8c-4e58cfdb27e0","resolution":{"observed_at":"2026-08-10T18:49:33.764374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12990","last_updated":"2024-11-20T02:38:24Z","snapshot_observed_at":"2026-08-19T08:26:44.789995Z","submitted_at":"2024-11-20T02:38:24Z","title":"BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12990","snapshot_observed_at":"2026-08-10T18:49:33.767557Z","title":"BetterBench: Assessing AI benchmarks, uncovering issues, and establishing best practices,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.767557Z"},"links":{"cited_paper":"/paper/2411.12990","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:76816da900be9b7c5d99bf9a0cf1ec5b6dfee5f5041a265ca2c7c3f6a989ec0d","observation_id":"a06a3084-6a48-43ef-ac07-ca6d4b9cec1b","resolution":{"observed_at":"2026-08-10T18:49:33.767557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-10T18:49:33.666532Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T18:49:33.666532Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2608.06898"},"observation_digest":"sha256:3feb0fbb17ed897d749f910fd2fcc13e17947107d2231c3489884cfd573655a8","observation_id":"4fba2ce8-f8cb-485e-abea-b0c421c4bd37","resolution":{"observed_at":"2026-08-10T18:49:33.666532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06898","last_updated":"2026-08-07T07:33:25Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-20T10:58:22.320666Z","submitted_at":"2026-08-07T07:33:25Z","title":"How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.06898."}