{"as_of":"2026-08-05T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13e7049a0af770a12d13d1fcac8a29f08e95ee31b2e91ec86968284ee2feb952","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T01:10:55.850274Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:39:07.075356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T04:57:38.604855Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-08-04T19:39:07.075356Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09154","last_updated":"2025-09-11T05:23:22Z","snapshot_observed_at":"2026-08-04T19:38:53.910372Z","submitted_at":"2025-09-11T05:23:22Z","title":"Mind Meets Space: Rethinking Agentic Spatial Intelligence from a Neuroscience-inspired Perspective","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-04T19:39:07.075356Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2509.09154"},"observation_digest":"sha256:50cf46d30482e2e885610af4470f7377304f56f9e71563c6a7b1f7209325abcf","observation_id":"f9ad8420-686a-4da6-9528-a95aa196d81e","resolution":{"observed_at":"2026-08-04T19:39:07.075356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":"2503.16492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-07-03T04:57:38.604855Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","venue":"cs.HC","work_id":"6180d42c-0030-47ff-bae1-62818e8d69d6","year":2025},"citing_paper":{"arxiv_id":"2512.10719","last_updated":"2026-07-12T18:02:23Z","snapshot_observed_at":"2026-08-03T17:07:38.286115Z","submitted_at":"2025-12-11T14:59:07Z","title":"SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T12:17:54.325055Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2512.10719"},"observation_digest":"sha256:c0dc0b7c871c947a47b0420ff10e3659fee95c70eaf78701189686185ef2a7a3","observation_id":"b9f2c4a1-f946-4ca1-afb4-b51790544ce6","resolution":{"observed_at":"2026-05-22T12:21:31.264373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-08-03T17:07:42.809307Z","title":"Fam- hri: Foundation-model assisted multi-modal human-robot interaction combining gaze and speech.arXiv preprint arXiv:2503.16492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10719","last_updated":"2026-07-12T18:02:23Z","snapshot_observed_at":"2026-08-03T17:07:38.286115Z","submitted_at":"2025-12-11T14:59:07Z","title":"SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T17:07:42.809307Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2512.10719"},"observation_digest":"sha256:bfabfee805b133e166cb179ed5ce33ca424608f56a9c4567870b65025e214131","observation_id":"0601019d-8154-4643-a96d-f50bc647a580","resolution":{"observed_at":"2026-08-03T17:07:42.809307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"cited_work":{"arxiv_id":"2503.16492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16492","snapshot_observed_at":"2026-07-03T04:57:38.604855Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","venue":"cs.HC","work_id":"6180d42c-0030-47ff-bae1-62818e8d69d6","year":2025},"citing_paper":{"arxiv_id":"2606.10276","last_updated":"2026-06-09T00:50:29Z","snapshot_observed_at":"2026-07-06T23:49:32.647742Z","submitted_at":"2026-06-09T00:50:29Z","title":"Hierarchical Policies from Verbal and Egocentric Human Signals for Natural Human-Robot Interaction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T13:31:02.640975Z"},"links":{"cited_paper":"/paper/2503.16492","citing_paper":"/paper/2606.10276"},"observation_digest":"sha256:a117f0188b11c1d77f84d46790109ecde73280681f7fc435dfa16cb3ef5b69c9","observation_id":"8c624a78-df58-47cc-82e1-a232ae2d3f6a","resolution":{"observed_at":"2026-07-03T04:57:38.606095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.16492/citation-record","integrity":"/paper/2503.16492/integrity","json":"/paper/2503.16492/citation-record.json","paper":"/paper/2503.16492"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social robots in therapy and care","venue":null,"work_id":"f7be2be7-d371-4616-9f89-2641fb423ef9","year":2019},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f533f6c29d2a76a84909f5cec2967358246a0bd76ac5a48f16a06f9e3e605373","observation_id":"a90f630d-ffd0-4942-a234-0f17297e9db1","resolution":{"observed_at":"2026-05-23T01:15:18.498346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jubileo: An open- source robot and framework for research in human-robot social interac- tion","venue":null,"work_id":"b4673caf-862d-4ef9-9758-67f9a4013053","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f8f6be1cb82693139d10968a9dd6d8e93331d573a99a237785b96da6d7a15e80","observation_id":"2c5c96ee-84a7-45b9-b6a9-82fa5872d50b","resolution":{"observed_at":"2026-05-23T01:12:22.128820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-aware physical human–robot collaborative transportation and manipulation with multiple aerial robots","venue":null,"work_id":"d305107e-3430-4bd7-9c13-11be21669cd2","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:b0dcfcebebb42aa0c1fa41f6d236adb13cf5f4a9966064debbdbd97deabe78fe","observation_id":"f34bb0eb-1fa4-4202-b70c-34b47f84741b","resolution":{"observed_at":"2026-05-23T01:12:22.119264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Communicating human intent to a robotic companion by multi-type gesture sentences","venue":null,"work_id":"3b305cae-7d22-44ef-9616-44100381f57f","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:b4431025991056191f2dd4f7f5cd71a0ae3580c5d65472d214ace12b781216c0","observation_id":"d98a3c25-71e5-4f90-b9c5-728f256fc094","resolution":{"observed_at":"2026-05-23T01:12:22.134707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvp-hri: Zero shot natural voice and posture-based human–robot interaction via large language model","venue":null,"work_id":"e589db0a-1e6a-4ac4-a6d9-54e153115d95","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:aa8909aa55ae2bf4508daacb97323c05351987a6ba918d728220dd484db6c37c","observation_id":"5b6af122-e4a8-40b3-a9be-a587238033ad","resolution":{"observed_at":"2026-05-23T01:12:22.122045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot reading human gaze: Why eye tracking is better than head tracking for human-robot col- laboration","venue":null,"work_id":"a840e97f-993d-4c18-a299-8de05f0c63d0","year":2016},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:51920156abf819c16dc1e02ca5ed8a78993166763a1b9e1bd0dc7f1ad12e6e26","observation_id":"e82bc16b-485c-4eec-99fc-960afc86de6d","resolution":{"observed_at":"2026-05-23T01:12:22.125007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A gaze-speech system in mixed reality for human-robot interaction","venue":null,"work_id":"7ecd1a6f-8d79-4d93-adc7-4ad69d16404f","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:89eef15edc70f5b922dca737927acaa03faf4b2edff071315c929d54cf540bc0","observation_id":"8b016c46-0c14-406b-9e6a-28c479563a7d","resolution":{"observed_at":"2026-05-23T01:12:22.115991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human–robot interaction through eye tracking for artistic drawing","venue":null,"work_id":"40b7ccb2-8a8b-460e-8911-8981b07bb0ec","year":2021},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:e83e03904efc849ed23b2e6c97412c002c042d82b126dc3623aafbb9a3b1a431","observation_id":"de8dca7e-1ef4-48da-8c8b-9c8aebb24d00","resolution":{"observed_at":"2026-05-23T01:12:22.110198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is it possible to recognize a speaker without listening? unraveling conversation dynamics in multi-party interactions using continuous eye gaze","venue":null,"work_id":"5c46bab4-3bb4-4ae2-8c23-9acec9c976c4","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:2a85542eb47e56f6c5df5dc4470502d7386a78292ed1c3bd811f97d54756b05d","observation_id":"5c486e0b-366d-4f44-8c52-95c382ebf73b","resolution":{"observed_at":"2026-05-23T01:15:18.501692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eye-gaze control of a wheelchair mounted 6dof assistive robot for activities of daily living","venue":null,"work_id":"639eb1e9-5af3-4213-9ac5-b972eac061ea","year":2021},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:1184bc620bbb876e5da36f79d1108a2e78e3902e4e4996d1342c4de001b4c677","observation_id":"8466c8fb-5ca1-4abc-a755-aedd77d4e226","resolution":{"observed_at":"2026-05-23T01:12:22.137422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Free-view, 3d gaze-guided, assistive robotic system for activities of daily living","venue":null,"work_id":"2f3b8bf0-b55d-43a3-8aca-dff0cbe70875","year":2018},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:8aee8c70fb53e34a8065af5bc4572da9fe749af3442637ee5b91bad2af5a839a","observation_id":"935e96a0-07e1-43b4-abba-59deb811e27b","resolution":{"observed_at":"2026-05-23T01:12:22.132103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsaccade-inspired event camera for robotics","venue":null,"work_id":"d1cee447-65d6-4cb8-b74c-12d2c1ef4bde","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:224bbe3de502370e73766bb8131d8adc4889be71676002c952805ca3b05f2301","observation_id":"2ec08df2-47da-4ebf-b7ba-6311edd74354","resolution":{"observed_at":"2026-05-23T01:12:22.113054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":"2308.13561","doi":"10.48550/arxiv.2308.13561","metadata_source":"pith","pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","venue":"cs.HC","work_id":"31d9f2a7-f783-4294-9a2c-0a033b2b15fa","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f1f7145d215c3430805ca4e63e9c2c4e47dc6f7d24ffe3b6fef304cb60384a6d","observation_id":"84a328ec-92e3-407c-bad0-6116ac31cee4","resolution":{"observed_at":"2026-05-23T01:12:20.528544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust gaze- based intention prediction for real-world scenarios","venue":null,"work_id":"e5e4d0b6-edcd-44a0-8218-8922135d8076","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:4138214397556f6cf93525368382ccfd76eff9c19f45c676a13b1e914a73f495","observation_id":"9599ee3f-bdf7-433d-b998-3f8e424e18fd","resolution":{"observed_at":"2026-05-23T01:15:18.620189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Getting to know your robot customers: Automated analysis of user identity and demographics for robots in the wild","venue":null,"work_id":"875ea438-e654-4472-8a2c-0e99eb9febb3","year":2018},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:a9f10b0a447cdcf629cdbdbfabc907b8933a07d5ce390a6875a8c0b510c952be","observation_id":"ea247167-bc67-49e9-afed-9df33b676395","resolution":{"observed_at":"2026-05-23T01:15:18.617076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A personalized comfort space with variable shape based on environmental information for robot navigation in homes","venue":null,"work_id":"e2c0e3fe-615a-4169-94e9-ada02966589b","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f7220ee2df691b28eb084830dde7ed7a4943939a1ebc45762d8965dde8dc4f41","observation_id":"910f1d15-3185-4d1a-b07e-28c592d36a60","resolution":{"observed_at":"2026-05-23T01:15:18.613531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving the collision tolerance of high-speed industrial robots via impact-aware path planning and series clutched actuation","venue":null,"work_id":"90cea824-1c60-4857-9a44-973725aa8bfb","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:cba7351eb6e2d0c63319ace91db865aef04ab595dec2fa50da8de87b93cef451","observation_id":"afe87ad1-6531-44e1-a26d-41153c03a66c","resolution":{"observed_at":"2026-05-23T01:15:18.610101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In situ calibration of six- axis force–torque sensors for industrial robots with tilting base","venue":null,"work_id":"e1f297d0-0198-4be4-8f4e-b8738e29ace1","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:93d632463c8ac5d7ad7c90244c537a22c1992748d54c8a8fdb57d2bb98cf9b63","observation_id":"a57f45cf-4fa9-494c-8990-9392a22f9248","resolution":{"observed_at":"2026-05-23T01:15:18.606522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gesture-informed robot assistance via foundation models","venue":null,"work_id":"c3e72044-fe6d-4951-9f04-a996e0848b36","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:30ec14bbe724ca94eb8132d03f20fd9101a7cc2ad5b99a479cc8119bd48f4595","observation_id":"e243694a-600a-4025-af69-5088701a14c1","resolution":{"observed_at":"2026-05-23T01:15:18.603049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interactive multimodal robot dialog using pointing gesture recognition","venue":null,"work_id":"6aafe4b6-b791-4d81-8268-9f84062bddd7","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:38df63d628439f98b9009a59647eab20604d22a6b8ad79e41e372fd8616fe0d3","observation_id":"940510b7-d6c0-4d94-92e9-14a5af3548a0","resolution":{"observed_at":"2026-05-23T01:15:18.599715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":"02bd6581-5303-4fb1-9f7c-c3b072574f13","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:90ec22d4bd2cadc3987090c964eafb2e0e398f10bbec2e974efdc7897149ccf7","observation_id":"496eb716-9ef3-4144-b255-ac71be72844e","resolution":{"observed_at":"2026-05-23T01:15:18.596254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":"eda74972-8555-4752-b8e8-b2c46ae56744","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:7f04cce5cbeee8ebe1bdca647ff9970c7e0ace3de7145729e632ab627274b7fe","observation_id":"0b0e1534-af26-4086-bd52-341690d9cfd4","resolution":{"observed_at":"2026-05-23T01:15:18.592956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semi-autonomous robotic arm reaching with hybrid gaze–brain machine interface","venue":null,"work_id":"a95306b7-a329-4a4b-94e1-f384ec0e5fb5","year":2020},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:d0521b0b6cf28ed9f80582514c6151091f7e8668f328e19aa9e960f3275646cf","observation_id":"de495b96-5a16-4344-bf7c-f97d58b016be","resolution":{"observed_at":"2026-05-23T01:15:18.589241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating the usability of collabo- rative robot control through hands-free operation using eye gaze and augmented reality","venue":null,"work_id":"b715b1db-89f6-4192-ae1d-c99047a75113","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:8399cdf5732af8e51f1d7dc984fb9b2621bcae0c9a3f9e5e116931ee244838eb","observation_id":"0c579db8-c1f5-44ad-abe7-36cdd32dcd11","resolution":{"observed_at":"2026-05-23T01:15:18.585779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human gaze following for human-robot interaction","venue":null,"work_id":"d4ae3625-10c9-4bf4-b103-62deacfe9b97","year":2018},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:0690465c6e0a6d0ee483b9a7e945d8d139d5925be6746de348af3a27a7d82d86","observation_id":"c424de04-57ed-4f11-bde6-5bdfb2588bf8","resolution":{"observed_at":"2026-05-23T01:15:18.582187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gaze-based attention recognition for human-robot collaboration","venue":null,"work_id":"43337829-35c1-4887-b007-23ab3fffcb0a","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:ee9d1485ead3b2ae040f212cc7fd98ee010bb94d32c53775ef70e46b7fb3c43a","observation_id":"f52a08cc-f2d2-4f1a-9642-e0fb93061f79","resolution":{"observed_at":"2026-05-23T01:15:18.578972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A novel human-in-the-loop multimodal intention fusion method for human-robot interaction","venue":null,"work_id":"f477eeb1-6020-4b78-9715-0299a6067eff","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:8d5421e70896b15a2bdf14572172eea8afe2a18c717acf4c4e3748521b23910b","observation_id":"5751a08f-385d-46d0-b29c-f6e50498ead3","resolution":{"observed_at":"2026-05-23T01:15:18.575616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alchemist: Llm-aided end-user development of robot applications","venue":null,"work_id":"4612c393-c03c-45a9-9f80-593c34724a0a","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:0ad8a852f64b89b856369617b5b270231a22d216c588ce1b80b480ada72f9b85","observation_id":"8578005a-437a-419a-96ab-d558537fcaee","resolution":{"observed_at":"2026-05-23T01:15:18.572180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lami: Large language models for multi-modal human-robot interaction","venue":null,"work_id":"c1c3a2c4-3926-4024-82d8-119719f3ca67","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:82ac9a97baff474f1e2c74820a81d9d05eb0b6ef4a373044c9eee3c1db778975","observation_id":"ecbd186f-2683-4c15-8ba5-4f0afafe9617","resolution":{"observed_at":"2026-05-23T01:15:18.568621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervi- sion","venue":null,"work_id":"73a99f0d-1a81-4841-9d1b-a5916956f678","year":2023},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:ecf70775bad0233db8b4fd06e2ffcca44f37db90542602cb7686532ff35de5f8","observation_id":"bb177b39-f85f-4513-92e2-f0658bc631a8","resolution":{"observed_at":"2026-05-23T01:15:18.565092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding DINO: marrying DINO with grounded pre-training for open-set object detection","venue":null,"work_id":"9883523b-510a-48aa-bfff-e539cc79b535","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:ad4ce7b8fc230c35ffabcbb386117fa8bcb472fc6b5a7f373a801d4157a541ee","observation_id":"a72528e2-30a4-4431-aa57-a0b3192fc074","resolution":{"observed_at":"2026-05-23T01:15:18.561791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":"b2000cd3-7171-4337-8988-dc0e8aef4d48","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:a52f3968ad846d599f2541a445722dd615c67519f36e6dc7da3411cb853df89a","observation_id":"ce1f1fe4-5005-4905-ad46-a85942036ea9","resolution":{"observed_at":"2026-05-23T01:15:18.558174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ORB-SLAM3: An accurate open-source library for visual, visual-inertial and multi-map SLAM","venue":null,"work_id":"65b8eede-23cc-423f-afdb-0b9aeaed30fa","year":2021},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:edbf9345e40ac0e172eb0478af1f7879fc08f4f590b65bf870fc86edd92c9507","observation_id":"9fda874c-469f-4bb3-a6f7-507ac3e52dcc","resolution":{"observed_at":"2026-05-23T01:15:18.554943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Super- glue: Learning feature matching with graph neural networks","venue":null,"work_id":"5e8fb0d2-05fc-450a-80aa-dab89e3093fc","year":2020},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f0e532a210b05982a0394624e33435152b2f5a05b9eec0c668991f36c48d554e","observation_id":"2c5ad54f-e294-4151-b0f0-2c4d1dcff7a8","resolution":{"observed_at":"2026-05-23T01:15:18.551583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design and implementation of a haptic measurement glove to create realistic human-telerobot interactions","venue":null,"work_id":"1356cb41-5223-4c19-95c1-a94f70f92492","year":2020},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:b8d4066d89a0c7263c62796948adfb68fa4191ad744992f1363c9e997fa855d9","observation_id":"1f99c207-0fb2-4a07-bf49-3715be11343f","resolution":{"observed_at":"2026-05-23T01:15:18.548125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Don’t yell at your robot: Physical correction as the collaborative interface for language model powered robots","venue":null,"work_id":"55d81420-9c85-4902-b630-7f7c54c43044","year":2024},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:321088222499e8301920b899cfc92d680ece945acfb16e2115813b4077bcb04d","observation_id":"7b540175-6910-4a4e-a4f2-d200020897b2","resolution":{"observed_at":"2026-05-23T01:15:18.544376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"7accc5c8-5053-4738-98fb-290e27ac8f2b","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:5998ae83668f43fdf8991fd962bfe8b6758f8dbf5ce40fc02aa24b1e868c49be","observation_id":"178de768-70af-43cc-90b0-4aaf91676fdc","resolution":{"observed_at":"2026-05-23T01:15:18.540619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model compression","venue":null,"work_id":"752e116b-35eb-4bde-9ae4-02621edbb895","year":2006},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:a5bbb5686b2238642c54e2ef3d94cd8399c6920fe82a4ae02c36732985108aff","observation_id":"acb66482-e5a4-4b3c-9f17-d229533c0146","resolution":{"observed_at":"2026-05-23T01:15:18.537242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"6c43612d-ac24-4cef-b7fa-71194134142f","year":2020},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:4c5c05871b35187e05cb30320fad6a832aec728b9d15c6ae14387e731725acf2","observation_id":"814818ae-8916-4fba-aca1-5f51523fa296","resolution":{"observed_at":"2026-05-23T01:15:18.534150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human gaze improves vision transformers by token masking","venue":null,"work_id":"b0ee847b-ef1f-4f41-836d-20d2d463aec9","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:9a405106233b8390c39240ea3b79ab1a84924002cd3cf30d9745196038e7de47","observation_id":"b1c3cf0a-1399-45fd-85ed-783303144749","resolution":{"observed_at":"2026-05-23T01:15:18.530595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":"dee581df-62af-40a9-8f05-cbd8616c8a25","year":2025},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f5d91d94a4fedf9ad580784f0e1783bdeb8671335d4fa89e78752c0e7fbe25aa","observation_id":"c56d6b22-0910-4d2f-940e-506fbbffe23a","resolution":{"observed_at":"2026-05-23T01:15:18.527137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-25075-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interactive multimodal robot dialog using pointing gesture recognition","venue":"Lecture notes in computer science","work_id":"c28ff671-2991-4886-9cdd-3aedb402bd7a","year":2022},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:b77bfd8340147ae5acfbf38f0d19974fa8357d723276737ecc4d75c85c06c64d","observation_id":"a4db9305-d286-4410-9fa0-ff7150e5c81d","resolution":{"observed_at":"2026-05-23T01:12:19.807631Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The speech recognition error in our system primarily due to misinterpretation of similar-sounding words","venue":null,"work_id":"aedffa87-f795-4338-8efa-e94c04679df9","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:4353dd3fa8e06767dbbc12f4dac247f5f6ce6007b280b602e69cb05067160e69","observation_id":"539233a1-3390-4a59-a9d1-24b70220ad98","resolution":{"observed_at":"2026-05-23T01:15:18.523573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"369efb53-32eb-405a-9887-a1104ce6b3e3","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:2999628cd2cf878277adf85656244071b8368d347c1d61bede208fbf1f797111","observation_id":"1bf8564e-aeb3-4089-85b9-e3865399e044","resolution":{"observed_at":"2026-05-23T01:15:18.519970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fea- ture matching using superglue becomes unreliable in the presence of weak object textures, repetitive patterns, or partial occlusions, leading to incorrect correspondences","venue":null,"work_id":"798b2028-8a90-4c3f-bd27-9ad3f693a0d7","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:12fcf6aeb2168068631f056e5ed58a0a89d6631c66c4379d91f7dcb63a608c46","observation_id":"eff27f64-7fbf-4972-a976-62c64a22edbc","resolution":{"observed_at":"2026-05-23T01:15:18.516832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Since FAM-HRI requires the LLM’s response to strictly follow a prede- fined prompt format, any deviation renders the output unusable by subsequent system modules","venue":null,"work_id":"887b70fb-0693-42d3-aa55-be9c72c7228d","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:f5b46eeb333469e2a28cc1cbe856a2259cd64bac96c7a540bd71845abc0cbe07","observation_id":"afcba079-64b8-4e3e-ae7d-5b6cbcf93483","resolution":{"observed_at":"2026-05-23T01:15:18.513854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"44eb65e1-86e4-4a11-adb5-d3fd129897e1","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:23466bc17545da5036b85fbb36313cca48120d33aca9f646dc839085db313c84","observation_id":"ee2e4734-419e-463b-9803-3a8b807a24d2","resolution":{"observed_at":"2026-05-23T01:15:18.510143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"803de094-556d-473f-b4b1-c0b6cc5c9b44","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:9336513bae7e54ba3b07fea032921455bc5308772c1c10ffa961845fc2745874","observation_id":"cc3d4649-3672-4fd2-80a2-53745af9c675","resolution":{"observed_at":"2026-05-23T01:15:18.507120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"13c27f13-45d3-4a23-a00f-74049027a017","year":null},"citing_paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T01:10:55.850274Z"},"links":{"citing_paper":"/paper/2503.16492"},"observation_digest":"sha256:a47c20b75c2cdf40690d9d0c6582bdb96ebceeb772905454fa01385d39105be9","observation_id":"11f0fb02-9e1d-4821-9e3e-14599f2dd333","resolution":{"observed_at":"2026-05-23T01:15:18.504367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2503.16492","last_updated":"2026-05-18T15:52:30Z","latest_version":3,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-03T14:11:28.422536Z","submitted_at":"2025-03-11T02:30:15Z","title":"FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":2,"verified_fuzzy":43},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 4 inbound Pith citation observations for arXiv:2503.16492."}