{"as_of":"2026-08-07T10:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1691ef8a8acb36f693a9e6301fa1ffbb9b7feb57cec0d2e136f7b75860a7b56c","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:39:45.335102Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22522/citation-record","integrity":"/paper/2507.22522/integrity","json":"/paper/2507.22522/citation-record.json","paper":"/paper/2507.22522"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.747866Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transform- ers","venue":null,"work_id":"16687aa2-a802-48ce-ad22-035526b43164","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:42.437707Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:557e18605c291ff8893cebb60ec673b9ab8d899c63610722810984a7b0f3508a","observation_id":"4609ec3e-fece-4d04-bb26-06cd8d5d16a3","resolution":{"observed_at":"2026-08-06T11:39:48.752438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.732443Z","title":"3di- naction: Understanding human actions in 3d point clouds","venue":null,"work_id":"e378abe6-a6aa-4431-bc04-83dfa8d1335f","year":2024},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:42.488746Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:e3e3ac165ffb25cfa9739ff3063c426564824bba0d83ca71424b86d55389128d","observation_id":"840c8107-ff93-40f1-915b-c0184db5a7ed","resolution":{"observed_at":"2026-08-06T11:39:48.737507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.717827Z","title":"Intelligent human activity recognition for healthcare digital twin","venue":null,"work_id":"abd4bf56-0ded-4595-b7ce-e0bab9e787ef","year":2025},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:42.571481Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:5147b3cb0cde94b88ea0224e145ca1629e4426eedae12775600bad7bf8f0325c","observation_id":"adb1dec2-ad7f-4da9-9502-473108eb3051","resolution":{"observed_at":"2026-08-06T11:39:48.722673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.703079Z","title":"Smg: A micro-gesture dataset towards spontaneous body gestures for emotional stress state analysis","venue":null,"work_id":"35d5760a-e75b-42fd-b988-e6cd28e3768d","year":2023},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:42.657059Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:8516cef304c9de5f60f35a8010848f9536fd1916b6fc7f7989bfee0f69ae12e2","observation_id":"3cdc3475-4517-41c2-94b6-8c82beebe209","resolution":{"observed_at":"2026-08-06T11:39:48.707715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.689433Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"c7d13008-827c-4a2f-8388-c59d799e476d","year":2020},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:42.750908Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:b0a780c8bd5589de9adf24b316ef34de73b2c1fb0d995b4d54e6c729346d8b32","observation_id":"8209cb9c-8e4f-4818-8b4b-e6a159572df9","resolution":{"observed_at":"2026-08-06T11:39:48.693852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.674081Z","title":"Point 4d trans- former networks for spatio-temporal modeling in point cloud videos","venue":null,"work_id":"7fa92ecd-5923-4bd2-b79e-752e70ce279e","year":2021},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:42.814884Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:6dc1e55945e173cf4e33128752c90036ce1d5a6f58a219772cc25298322be297","observation_id":"de8484b8-0358-4e4b-9469-dc95e6f948b9","resolution":{"observed_at":"2026-08-06T11:39:48.679071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.658462Z","title":"Kankanhalli","venue":null,"work_id":"9bfb7da1-eaae-418e-97f5-bccb52fd8a06","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:42.931130Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:edc283267c6dda4e03c811e538998804588561c289ca12d1841c3f0012ae9de9","observation_id":"27a5ff2b-ace2-4526-a374-e63266a33a99","resolution":{"observed_at":"2026-08-06T11:39:48.663214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.644335Z","title":"Deep hierarchical representation of point cloud videos via spatio- temporal decomposition","venue":null,"work_id":"cc7e72f0-d480-41d8-84b9-8ae406fa5567","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:42.999426Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:0e05ec15cf1b846fdaf0ebf1566605eab0b6767689a80810b707c90a1f2053d0","observation_id":"e9f4906e-eef6-476a-8628-b47a2299ec94","resolution":{"observed_at":"2026-08-06T11:39:48.648904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.627828Z","title":"Point spatio- temporal transformer networks for point cloud video mod- eling","venue":null,"work_id":"057f2881-a491-4aeb-a082-4fd8d84ab445","year":2023},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.083211Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:cf7b2a9b6f5c983655e6fe92dbb54e2a65c1047c4d1ad3d32fbfcdd2e7337bda","observation_id":"9d76c130-4d5f-49aa-be26-b12a04f4cdf5","resolution":{"observed_at":"2026-08-06T11:39:48.634228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.612573Z","title":"Detecting masked faces in the wild with lle-cnns","venue":null,"work_id":"3db50dab-d60b-4e72-ba44-ef4427e8c31f","year":null},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.151558Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:7bfe48f1e87b8cf8795aba03bb6c34a1adcb6a99b9987cd6bd52dee7a5220b24","observation_id":"f4fc4f09-25fd-4d57-b2b5-f3e31e8369da","resolution":{"observed_at":"2026-08-06T11:39:48.617278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.597983Z","title":"Uniformer: Unifying convolution and self-attention for visual recogni- tion","venue":null,"work_id":"8d6c4ca8-ac14-4d99-9303-52ca06f0b160","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.224576Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:bccfd832aca8ae3bd72601f869fffa4ff117e0e7f750ae8a80c064d419f1cf7b","observation_id":"2df85039-49c3-40e3-9f87-a9c7fd1f7ec1","resolution":{"observed_at":"2026-08-06T11:39:48.602639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.583390Z","title":"Uniformerv2: Unlocking the po- tential of image vits for video understanding","venue":null,"work_id":"551590dd-43d8-4b0d-9fa3-db9b8fa528a7","year":2023},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.292713Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:0e49b4ccbc9d19d5aefa25e27d966c28a6263c7a7aaa7f2517d8ba20aa99ef50","observation_id":"0e4c5645-21cf-4e0f-b3d4-8563340cde0f","resolution":{"observed_at":"2026-08-06T11:39:48.588028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.567765Z","title":"Action recognition based on a bag of 3d points","venue":null,"work_id":"d7c2536a-8675-4b7b-bbc0-79c4499fd6e9","year":2010},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.369735Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:b582f4ea442166507db06da1715f73908292489ea789ad4fda3fc70fd167ea42","observation_id":"76ba6b72-a152-4c07-80b4-1110178bda79","resolution":{"observed_at":"2026-08-06T11:39:48.572874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.552534Z","title":"Mvitv2: Improved multiscale vision transform- ers for classification and detection","venue":null,"work_id":"c24460eb-2ff9-4421-9586-982ef25af8b5","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.447281Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:c9db5b9af2802c02bbcc449171ee54846ac66a7aae85beeff5bfc77e7e3c5411","observation_id":"1a91c0f5-24fe-4a9d-8cb7-68ce47a62e28","resolution":{"observed_at":"2026-08-06T11:39:48.556613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.538979Z","title":"imigue: An identity-free video dataset for micro-gesture understanding and emotion analysis","venue":null,"work_id":"0fadddf7-0e54-40fe-a287-1445335b443d","year":2021},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.538678Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:4af5cd933f35f43a3e67ebbe7ed0bca022ec2f1a3839515167550c416e536e3e","observation_id":"d92bf5c9-becf-42ad-9111-6a3293d7947d","resolution":{"observed_at":"2026-08-06T11:39:48.543491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.524341Z","title":"Leaf: Learning frames for 4d point cloud sequence un- derstanding","venue":null,"work_id":"3fef6a8e-165c-4a61-8974-5044c53b563a","year":2023},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.610343Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:404f225c77d9a0f90fe8902e1621516bb4ea0c82a5ccd74744f3862b654bbbb7","observation_id":"2e6a026f-e64c-452a-8d00-6309ff8defa2","resolution":{"observed_at":"2026-08-06T11:39:48.529308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.510680Z","title":"Video swin transformer","venue":null,"work_id":"b5695154-9810-4bc8-90ce-c99dc5202e5f","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.682341Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:c2b0683b37349e2506d4903901e370c54dd40803cabea1a8d45589b960a25c41","observation_id":"978d0568-1c5b-4fcd-8a4e-a639058853bf","resolution":{"observed_at":"2026-08-06T11:39:48.514774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.496081Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"382bacb6-549c-4058-a521-3545f0dedc08","year":2017},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.724943Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:b35727bcae5c3fed18bd45814b7942238102bf2c729668ea63672c4464df4950","observation_id":"7de8c581-638d-4652-8edb-5c6ac0dd2f80","resolution":{"observed_at":"2026-08-06T11:39:48.500369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.480720Z","title":"Design of the human-robot interaction for a semi-autonomous service robot to assist el- derly people","venue":null,"work_id":"6f6a74b5-a4a1-4945-affe-703ad5bb2b29","year":2015},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.820020Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:38d15e25d327fb45bd1909725eac0d6e7ba08dba8d9ec5dffa30f7d468f1fc9c","observation_id":"275764ec-63a5-4f74-8328-4e7d3fac470b","resolution":{"observed_at":"2026-08-06T11:39:48.486152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.464608Z","title":"Recognizing micro actions in videos: learning motion details via segment-level temporal pyramid","venue":null,"work_id":"255b7359-92f7-4a8d-a444-e49311046a00","year":2019},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:43.918132Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:4d12cc1ea38cbd89819d590ab00f1f980b015f132026f75ca63352b80cc269f4","observation_id":"4e231317-679f-47b7-a810-bb714ab6b0f2","resolution":{"observed_at":"2026-08-06T11:39:48.470181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.410700Z","title":"Ntu rgb+ d: A large scale dataset for 3d human activity anal- ysis","venue":null,"work_id":"f39e388a-87c1-43cf-b2b1-8af151853289","year":2016},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.008738Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:4f7c253cf6357c8166f0e73ae4a367d26b6c3d5ab25294a17dcffb9119347f37","observation_id":"6bf6c2c9-f92c-42fc-bc4d-e72848e24fba","resolution":{"observed_at":"2026-08-06T11:39:48.454114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.228578Z","title":"Pointcmp: Contrastive mask prediction for self-supervised learning on point cloud videos","venue":null,"work_id":"63747bbb-6c21-421b-921a-c12024d8c73a","year":2023},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.104558Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:ebbb94c53a6ffd4c0936b7b97fc9c53ad338fb4f7176966ef7166bc8508e8b04","observation_id":"5679358a-f72e-4b4b-be8a-3df50ccb7a81","resolution":{"observed_at":"2026-08-06T11:39:48.384200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:48.107336Z","title":"Point contrastive pre- diction with semantic clustering for self-supervised learning on point cloud videos","venue":null,"work_id":"b2920cc1-1836-4c93-b5d2-7463b99995d2","year":2023},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.170664Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:37f67c97ea7f81184dab62b8aa4f289415ea75720af487e86008c3c7d398d8df","observation_id":"1ee07151-25bf-46bf-9196-954069f15062","resolution":{"observed_at":"2026-08-06T11:39:48.148135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:47.835008Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"665316a0-2fae-415f-9669-e542252e095d","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.256140Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:630583d89eb3762787044c82c7feec84f235d927c1ba60a81d5cc4cb0f87a053","observation_id":"f41f51c7-b5ca-47fe-a487-64e421e117ba","resolution":{"observed_at":"2026-08-06T11:39:47.974897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:47.552971Z","title":"Visualiz- ing data using t-sne","venue":null,"work_id":"fd3315cf-32ed-4a19-ae99-35c09936ea19","year":null},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.333156Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:5d81f3fa6a35d32c7eb63cf513aae9070d6ef4dc807b120fc38c7ca8aee98790","observation_id":"64c6252b-1c18-4cf6-a622-9d56ddcbfee1","resolution":{"observed_at":"2026-08-06T11:39:47.704539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14458","last_updated":"2024-10-30T01:49:34Z","snapshot_observed_at":"2026-08-06T19:21:44.821168Z","submitted_at":"2024-05-23T11:44:29Z","title":"YOLOv10: Real-Time End-to-End Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14458","snapshot_observed_at":"2026-08-06T11:39:44.424447Z","title":"Yolov10: Real-time end- to-end object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.424447Z"},"links":{"cited_paper":"/paper/2405.14458","citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:9e65f0a5e7cec33be1fee21b10844416b2382839393c5e566e1d378a56bf226c","observation_id":"ee5fb01f-bde1-4db4-9f7b-117f505bccc3","resolution":{"observed_at":"2026-08-06T11:39:44.424447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:47.221294Z","title":"Temporal segment networks for action recognition in videos.IEEE transactions on pattern analysis and machine intelligence, 2018","venue":null,"work_id":"ff254fcb-1fb0-483c-bbbc-4dd5d94862af","year":2018},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.538402Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:41e24c78729324dcbe98fb7ebae9a60c04782149447b39390ba494df7d16cbd7","observation_id":"3cf7a7db-d5d1-404d-b8e7-4b4ccb30ba1c","resolution":{"observed_at":"2026-08-06T11:39:47.419263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:46.971029Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":"32afef1c-a72a-469c-846d-06d9b8686df5","year":2023},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.644524Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:e88bc51cda19585fa6af9461aa700a81a18bb0b2d4c9ee423ceec90d591603cf","observation_id":"36f3c204-04f4-42b9-938f-a84e8e01c7e9","resolution":{"observed_at":"2026-08-06T11:39:47.097676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:46.768749Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":"8f920d63-81ca-44b8-8c30-6c3314c8fbbc","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.756523Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:85efa099f9d0c0240db3828781fa7ec610de6bb8d06bcd9e857aa5e869127082","observation_id":"75fae74b-cebb-49ba-9b8c-ed16be5de5c7","resolution":{"observed_at":"2026-08-06T11:39:46.839619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:46.419939Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"c0e244be-a22b-415d-9212-4494f80d3e00","year":2024},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.836225Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:2754433f8eb98175fa9499d1178f5999cf2df8dd0b1106db4a533acdaddf14f1","observation_id":"95409eb5-1087-433f-a7ac-c4090c7da6cf","resolution":{"observed_at":"2026-08-06T11:39:46.576873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:46.213149Z","title":"Modeling 4d human-object interactions for event and object recognition","venue":null,"work_id":"4344e7bf-91fb-456f-84b8-ea1b43fd29cd","year":2013},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:44.901417Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:2d3cf636704815be82c45dcaf6d8de3c273753e8fc343df3c4242026b70def67","observation_id":"9f5bb46a-d05b-48cf-8da9-9b1c84f3e3b6","resolution":{"observed_at":"2026-08-06T11:39:46.303921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:45.901064Z","title":"Fine-grained action recognition using dy- namic kernels","venue":null,"work_id":"d95755fc-c0eb-4243-ada0-2d1b992ce56f","year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:45.036959Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:da65fa80d8f8da2bd843fef5b7a17051aa78f571bd66cd1a39d22023b81219ba","observation_id":"7811c259-6da3-49d5-825e-b77003755a4b","resolution":{"observed_at":"2026-08-06T11:39:46.063532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:45.644823Z","title":"Recognizing micro-actions and reactions from paired egocentric videos","venue":null,"work_id":"6a07cea5-fbc0-46da-9591-5fede0c77b4c","year":2016},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:45.181744Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:623a36b73b873f08abf5e71199e0168bd69e62cc8da914a953a5aa0ac7db2316","observation_id":"879d5125-270a-4407-9618-191117c5c0ca","resolution":{"observed_at":"2026-08-06T11:39:45.728367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:39:45.335102Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:39:45.335102Z"},"links":{"citing_paper":"/paper/2507.22522"},"observation_digest":"sha256:16d07b1b4aa82d627ee1b7bfc6a0063c69be4ba747ffa9529bc7555d3d000574","observation_id":"d632101f-aab7-40e1-921d-c6c26172002d","resolution":{"observed_at":"2026-08-06T11:39:45.335102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22522","last_updated":"2025-07-30T09:48:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:22:24.074679Z","submitted_at":"2025-07-30T09:48:34Z","title":"Recognizing Actions from Robotic View for Natural Human-Robot Interaction"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2507.22522."}