{"as_of":"2026-08-08T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa77d68c6c43e8fc842cae619bdcf7dfd5c60927b3a3d44592084bb843222ad7","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:49:10.881232Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:43:33.391528Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20566","snapshot_observed_at":"2026-07-14T04:42:38.419346Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11570","last_updated":"2026-07-13T13:50:43Z","snapshot_observed_at":"2026-08-06T07:24:07.502337Z","submitted_at":"2026-07-13T13:50:43Z","title":"ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T04:42:38.419346Z"},"links":{"cited_paper":"/paper/2506.20566","citing_paper":"/paper/2607.11570"},"observation_digest":"sha256:7ea130af5e29da774632c88a622e26113a2b39e3dcb4de2d0e58a4b1f348634f","observation_id":"e94ac13b-5b75-40fb-92fe-c1c5ee6012dc","resolution":{"observed_at":"2026-07-14T04:42:38.419346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20566","snapshot_observed_at":"2026-08-02T08:43:33.391528Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13056","last_updated":"2026-07-05T09:15:35Z","snapshot_observed_at":"2026-08-07T22:39:41.373055Z","submitted_at":"2026-07-05T09:15:35Z","title":"HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:43:33.391528Z"},"links":{"cited_paper":"/paper/2506.20566","citing_paper":"/paper/2607.13056"},"observation_digest":"sha256:3304f1f8cd384880b08dd5de84df88959adb6f03f98d5f2bf8f6c441f9c3fbc4","observation_id":"f3cf56be-7b34-4131-812e-7362bbde9172","resolution":{"observed_at":"2026-08-02T08:43:33.391528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20566/citation-record","integrity":"/paper/2506.20566/integrity","json":"/paper/2506.20566/citation-record.json","paper":"/paper/2506.20566"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18711","last_updated":"2025-05-16T16:46:31Z","snapshot_observed_at":"2026-07-06T19:58:13.816588Z","submitted_at":"2024-11-27T19:32:03Z","title":"Evaluating Vision-Language Models as Evaluators in Path Planning","version":4},"cited_work":{"arxiv_id":"2411.18711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18711","snapshot_observed_at":"2026-08-06T22:49:11.112158Z","title":"Evaluating Vision-Language Models as Evaluators in Path Planning","venue":"cs.CV","work_id":"cbf459c7-3d02-47fb-9dfc-3bea72a3c591","year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.509682Z"},"links":{"cited_paper":"/paper/2411.18711","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:97bb626bb5023e2824e2d2315815fc17ae0ec391f550cefe5959c91f18efd0b1","observation_id":"1a90adff-d994-4835-914a-c1ef00a2389d","resolution":{"observed_at":"2026-08-06T22:49:11.200446Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.914770Z","title":"In: Proceedings of the 19th ACM International Conference on Mul- timodal Interaction, pp","venue":null,"work_id":"16aac432-1dec-41b5-bb9a-264cde989105","year":2017},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.590463Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:179efd7e8bdf201dc2d6eb1f5acff8039422f854a7c4ea73ce2196f4a44c5415","observation_id":"962eeeb6-509b-491b-a217-70702f5a12f5","resolution":{"observed_at":"2026-08-06T22:49:17.057335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-08T06:49:54.589467Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-06T22:49:07.721472Z","title":"arXiv preprint arXiv:2505.15517 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.721472Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:f1bd6e979a2633caea6ab75f617a4dcb682b4a50550a74991166a55fd8063a31","observation_id":"71e0cde9-4a6e-48b7-bf08-c46222e1b4e5","resolution":{"observed_at":"2026-08-06T22:49:07.721472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.685189Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"3142740a-a504-4c68-9580-dbef2f9b1f9d","year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.813078Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:6780d58b80e35820659c43eb8254c9b56521ee6aaba27fe018ec660e1285b2e6","observation_id":"6138fe75-e541-450c-a7b0-2affee204481","resolution":{"observed_at":"2026-08-06T22:49:16.795102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.325183Z","title":"In: International Conference on Learning Representations (ICLR) (2025)","venue":null,"work_id":"8c5dce68-fcec-4dd4-9f62-4bac84696780","year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.915292Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:8dcd848c5069c927fa0971fd84bf2f271c5847e10f500a21c8d26351788e5bc6","observation_id":"a50c31f4-58d4-4301-bb48-80366c6c1157","resolution":{"observed_at":"2026-08-06T22:49:16.485703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.046998Z","title":"In: 2008 8th Ieee International Conference on Automatic Face & Gesture Recognition, pp","venue":null,"work_id":"888e660c-6ca5-4b1a-9649-b9675c476b4c","year":2008},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.077537Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:474b775cad3118726fe6f21aa11a63c854e6e03ea8ea2cc70a5b720b4aaab871","observation_id":"500ca7e8-8220-4aff-b648-776631922f9f","resolution":{"observed_at":"2026-08-06T22:49:16.193859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T22:49:08.200579Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.200579Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:dad62ec569eb12ba4e17140864fa095ec36c95f4aae2c25bec578d5b576f3e93","observation_id":"43fee879-e3ea-4fe5-9578-b03d930b3efa","resolution":{"observed_at":"2026-08-06T22:49:08.200579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:49:08.371492Z","title":"arXiv preprint arXiv:2407.21783 (2024) HRIBench 9","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.371492Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:adb66dd52196bcbe90b726bbc71a1d9ab149cb6c3dfdbf71047f4260351fa107","observation_id":"04f16770-e207-4dac-b03e-0b76b6c81956","resolution":{"observed_at":"2026-08-06T22:49:08.371492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:15.665994Z","title":"In: Neural Information Processing Systems (NeurIPS) (2018)","venue":null,"work_id":"e401e217-89a7-47be-a6e1-c6a119da4048","year":2018},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.475881Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:a0f6e0a0f663a6f4a09b1f3304de42653a21c857817af07fd15fb97daa428a78","observation_id":"7cfc5b71-6772-4b10-abd6-4f8f340cb62e","resolution":{"observed_at":"2026-08-06T22:49:15.866164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05821","last_updated":"2024-12-08T06:54:43Z","snapshot_observed_at":"2026-07-06T19:47:38.708013Z","submitted_at":"2024-11-04T18:01:34Z","title":"Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05821","snapshot_observed_at":"2026-08-06T22:49:08.555776Z","title":"arXiv preprint arXiv:2411.05821 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.555776Z"},"links":{"cited_paper":"/paper/2411.05821","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:564efccd4816d182c9c00508468359523399ff081a8a6bed57de46a138aac7ef","observation_id":"84759529-e6ae-4686-a506-72c9db046e09","resolution":{"observed_at":"2026-08-06T22:49:08.555776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:15.319166Z","title":"Human factors53(5), 517–527 (2011)","venue":null,"work_id":"6e8dc0fd-195c-4468-b372-387b33b81c9a","year":2011},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.658326Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:9ecb25bd83c4567696d18528b28e625331ad50702bf17e72548ba5182240925c","observation_id":"eaf7af65-57fd-49c9-b145-d09867dd3e2f","resolution":{"observed_at":"2026-08-06T22:49:15.496895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-06T22:49:08.758255Z","title":"arXiv preprint arXiv:2504.16054 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.758255Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:fbf831a4bd6b715b1c46f19d34fdcf053426e247db5dbbb601fef914c688f077","observation_id":"59c4f372-2edd-4317-aaea-6ba8c91afd8c","resolution":{"observed_at":"2026-08-06T22:49:08.758255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.962788Z","title":"In: Conference on Robot Learning (2023)","venue":null,"work_id":"2aff181d-7ec3-4737-a309-672d5eb273e4","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.876306Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:e12391e4a8a043d42b0706b3ccdbce420bc4ef5c28837b242b3dea25ca6dc74f","observation_id":"3440f35e-8fb1-4ba9-9e23-b74c19f90f4d","resolution":{"observed_at":"2026-08-06T22:49:15.105483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.600699Z","title":"Discourse Processes52(4), 255–289 (2015)","venue":null,"work_id":"f6bfc09f-bacb-43f0-af8e-25ede9544d3b","year":2015},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.993107Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:14abf621c65a3dadb658e3a1b8f3af8da79c7b153a3e7a284eca91b61511edf9","observation_id":"85b25a58-aa63-465c-9dac-fc4084039e6b","resolution":{"observed_at":"2026-08-06T22:49:14.752505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-06T22:49:09.088375Z","title":"arXiv preprint arXiv:2501.02189 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.088375Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:d2a28e9d09f38f0ddab5d14d65214213701bcb6786c2fca29300b789f02640b4","observation_id":"2a620a9f-dda5-4e84-9be3-0afa2b7e443a","resolution":{"observed_at":"2026-08-06T22:49:09.088375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.217180Z","title":"In: Robotics: Science and Systems (RSS) (2024)","venue":null,"work_id":"c5838c6e-ef44-4a85-827d-960913f33d69","year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.199127Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:1e2a8215ae7eb5ac278074b511135ead9c439de840a8ea89fd1069bef36bba7c","observation_id":"f7deb7e5-620d-4d07-afaa-baa9253c1041","resolution":{"observed_at":"2026-08-06T22:49:14.371159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.921531Z","title":"ACM Transactions on Human-Robot Interaction12(3), 1–39 (2023)","venue":null,"work_id":"719698d1-d22d-4b02-ae57-1773353dc2ff","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.350710Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:3682e482e64bc8b44bddfbff6938132a68cf25a0a6fc3e1ebc19af352f680f39","observation_id":"771afcae-c807-47e1-bc8d-dfd15e5b7eca","resolution":{"observed_at":"2026-08-06T22:49:14.066289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.571223Z","title":"https://robotsguide.com/robots/kuri (n.d.)","venue":null,"work_id":"6681f0e5-15ae-4c2b-b7ce-0553d5a643ed","year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.505490Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:10c59f45b3f1a659837301cdfefb9ef797bd31d2099d7ea1de655d83ce6f5b70","observation_id":"f17af41b-8e60-4a27-bc26-6d2157040c84","resolution":{"observed_at":"2026-08-06T22:49:13.769324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.135105Z","title":"In: 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pp","venue":null,"work_id":"8f1af75d-c670-492a-978a-629234b4951b","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.666785Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:5c3a76531d2cd0122d61af8669656ce97fe7eee48477ec23335a936b14c1cf68","observation_id":"c8b0254b-7d9e-4bb3-8206-9beb73ad23f3","resolution":{"observed_at":"2026-08-06T22:49:13.346604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.830648Z","title":"Image and Vision Computing25(12), 1875–1884 (2007)","venue":null,"work_id":"3c08f763-55f0-4d66-be63-7158f6df9498","year":2007},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.869220Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:f53bc5386d534df1d1ffc4b9c08d869b22f5b1ba4a3dcededd8a6098611db8d2","observation_id":"7fc6ee28-5da2-48ca-b3e4-943eb4eaed6d","resolution":{"observed_at":"2026-08-06T22:49:12.972703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:49:10.058113Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.058113Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:9915a6ea629ea400a46d2616608d059a758e037f5346b7968413e23f9d5250f3","observation_id":"da941580-0f76-4fb9-a786-311d074a0bac","resolution":{"observed_at":"2026-08-06T22:49:10.058113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.542182Z","title":"ACM Transactions on Human-Robot Interaction12(1), 1–66 (2023)","venue":null,"work_id":"572d4b9b-9a8c-4c75-9b43-dd87471ce4b8","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.170501Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:aec972fef8e7be754b00dce9249f8f55ba8a871e318aa19a885aadf203aa2331","observation_id":"e9872746-cccb-424c-8a30-bae22d03fa1b","resolution":{"observed_at":"2026-08-06T22:49:12.673737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.236295Z","title":"IEEE Transactions on Robotics38(3), 1755–1772 (2021)","venue":null,"work_id":"39cf9747-ec30-4fc5-b13d-b82f21a2ee8e","year":2021},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.326554Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:770067b1dbeef619e313cc3fd6a1d8f2da55034a0078984eb75d43e2d5736512","observation_id":"ac043cf2-4523-4df1-a8a3-7a424b53de3f","resolution":{"observed_at":"2026-08-06T22:49:12.374698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.934322Z","title":"ACM Transactions on Human-Robot Interaction 12(2), 1–21 (2023)","venue":null,"work_id":"ddc3a470-208c-47de-9a0c-ba8c01b274ff","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.477606Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:a6c10a44565ee6e457da58496b0d7234b625b54c934420192b508fd670415c86","observation_id":"d24db9c4-7666-4fdf-9c03-eba2412b1b6d","resolution":{"observed_at":"2026-08-06T22:49:12.095926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.627912Z","title":"Advances in Neural Information Processing Systems35, 12,014–12,026 (2022) 10 Zhonghao Shi et al","venue":null,"work_id":"3e7b0843-3e05-4ef8-ad89-3863bd0305ef","year":2022},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.621525Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:5831183e4b7be9656063d2777873f1ee294dda5df757a312daa31414be500e70","observation_id":"e218a7f9-66ac-44ac-9c42-c00fa81747a2","resolution":{"observed_at":"2026-08-06T22:49:11.776077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09698","last_updated":"2025-08-30T18:59:30Z","snapshot_observed_at":"2026-08-07T15:45:19.574832Z","submitted_at":"2025-05-14T18:01:00Z","title":"ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09698","snapshot_observed_at":"2026-08-06T22:49:10.769599Z","title":"arXiv preprint arXiv:2505.09698 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.769599Z"},"links":{"cited_paper":"/paper/2505.09698","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:de5c3f4df11408607b53edd1c87d6aaa8157c7a1752ca8362317cafa3566ab5e","observation_id":"f2ad57d4-4681-4293-8b70-f9451405badc","resolution":{"observed_at":"2026-08-06T22:49:10.769599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.336047Z","title":"In: Artificial In- telligence and Machine Learning in Defense Applications II (2020)","venue":null,"work_id":"554f09ba-68ad-4be1-a15b-bf3433da1127","year":2020},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.881232Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:95984f395894024e5fecc8d710cb07bed7fced444a8606c095922d309a07e509","observation_id":"d6210fe0-1cc8-4a6a-9776-53739c97e593","resolution":{"observed_at":"2026-08-06T22:49:11.460335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T22:43:09.691002Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 2 inbound Pith citation observations for arXiv:2506.20566."}