{"as_of":"2026-08-11T06:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8776c4f192173f79c06fbb688d0955b0a6474d28d75048185c2a8ae661e6101","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T12:49:02.418663Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:35:34.154516Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T00:35:34.361224Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"cited_work":{"arxiv_id":"2605.17517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17517","snapshot_observed_at":"2026-08-11T00:35:34.361224Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","venue":"cs.RO","work_id":"a1be23e3-54ef-449e-8f33-88a9e7677985","year":2026},"citing_paper":{"arxiv_id":"2608.07596","last_updated":"2026-08-06T08:12:32Z","snapshot_observed_at":"2026-08-11T06:16:12.102765Z","submitted_at":"2026-08-06T08:12:32Z","title":"LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T00:35:34.154516Z"},"links":{"cited_paper":"/paper/2605.17517","citing_paper":"/paper/2608.07596"},"observation_digest":"sha256:bde67e0b31c2724e8f9627779e46a5468e13d04dd88f8e2452254c5fede37578","observation_id":"26ed6c4c-190f-40b2-acc4-f190ccbacca1","resolution":{"observed_at":"2026-08-11T00:35:34.368582Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.17517/citation-record","integrity":"/paper/2605.17517/integrity","json":"/paper/2605.17517/citation-record.json","paper":"/paper/2605.17517"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexible robotic hand harnesses large deformations for full-coverage human-like multimodal haptic perception","venue":null,"work_id":"74803168-4159-4140-8515-ea3ffebf3c73","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:932d6ab0ccbc4bac6df507815101ae0d4356a68e34a14e4f9778a87a104b05bc","observation_id":"a80f3fb3-6906-453b-962a-2a7991877373","resolution":{"observed_at":"2026-05-20T12:53:29.129960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language-conditioned affordance-pose detection in 3d point clouds","venue":null,"work_id":"a75b382c-0649-4b4c-afca-ae0e656b56a7","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:4ddd11330fac1a80f71b3ea154089d95230a2ade07da14b9651f7b691245ae57","observation_id":"e42408a2-f256-4ec3-943d-0c76a2e70be3","resolution":{"observed_at":"2026-05-20T12:53:29.178106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uad: Unsupervised affordance distillation for generalization in robotic manipulation","venue":null,"work_id":"7106b15d-ae67-4d0c-96d6-3db8f351505f","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:62992e7b9a31ad0313fe279c3f056ee5f706afc136ebce755741f3a01f70545d","observation_id":"0a1a5556-9931-449e-aa6f-36b0dca8deb9","resolution":{"observed_at":"2026-05-20T12:53:29.190008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Affordancenet: An end-to-end deep learning approach for object affordance detection","venue":null,"work_id":"5674e695-cb95-42ab-9e11-8f62dc6a6c06","year":2018},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:163e1df57ed2468ded39a59f8aaf05e64f3f1713c29be83a78ae862a89723cd8","observation_id":"a4e492e0-bb0c-481c-b44b-27dc38e0c981","resolution":{"observed_at":"2026-05-20T12:53:29.172033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnimanip: Towards general robotic manipulation via object-centric interaction primitives as spatial constraints","venue":null,"work_id":"e0802bbf-27de-4bfe-b989-1df37fe50077","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:d8915b77d909fae8aee4dab82676f8faaeb530904e9031bce400d57fc4fc7d94","observation_id":"dba22695-6937-4e36-a271-9c7681c59e48","resolution":{"observed_at":"2026-05-20T12:53:29.162648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A0: An affordance-aware hierarchical model for general robotic manipulation","venue":null,"work_id":"37d407ad-e218-4d27-85cb-3b489b8a92c9","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:287bb79ef5a85cabc98b34c8f825022525f1731db2ccfebab68dcfba2a91e90c","observation_id":"e00a138e-3384-481c-a54d-b12839579ef9","resolution":{"observed_at":"2026-05-20T12:53:29.164870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manipvqa: Injecting robotic affordance and physically grounded information into multi-modal large language models","venue":null,"work_id":"9c62bae8-bb6f-4d3f-b88f-c8459730debb","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:f51693b91d8bd3fa1e15cf7b2da830e34e59b502eb7c994273db2806db639b4c","observation_id":"ae510d2a-34a0-4984-94a0-27c099ba9fbf","resolution":{"observed_at":"2026-05-20T12:53:29.192041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robots pre-train robots: Manipulation- centric robotic representation from large-scale robot datasets","venue":null,"work_id":"d110a6b8-5dbf-4288-b069-8b9aa829d42b","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:0f8f64b8af7fb88d79ed1d3167e04a89d53546ac2d6d8e97df0f0f0dfc4c128c","observation_id":"3462b2f8-4cd0-4b26-abb0-76a06ad58603","resolution":{"observed_at":"2026-05-20T12:53:29.193745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tars: Tactile affor- dance in robot synesthesia for dexterous manipulation","venue":null,"work_id":"df4506c2-bbd0-4594-823d-3d5d61f80a9b","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:e13164446fdb19c2d5c5cae8394442f4648f5d68e5eff8b6348ab4fa94000d0a","observation_id":"a161325b-5166-4c75-9223-9bde3d11b005","resolution":{"observed_at":"2026-05-20T12:53:29.131703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sa-dem: Dexterous ex- trinsic robotic manipulation of non-graspable objects via stiffness-aware dual-stage reinforcement learning","venue":null,"work_id":"4a233128-9ed7-4091-b6d4-5d7c8396c3eb","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:cd39f7b2dc6769998b526479bc12ee072cc8088ea6772989ffeb0386cffbde2a","observation_id":"0ab42483-c3c2-48fa-aa66-0363f8c7992e","resolution":{"observed_at":"2026-05-20T12:53:29.104422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":"182c7374-0449-4bf4-a0e8-91f85a6602fa","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:77182c27c4bdf1a47f1551a4f98b6003ace012eaa050b8489f379ba3d597f056","observation_id":"75f4f201-3e0b-41c0-a71e-84d5f40f79e4","resolution":{"observed_at":"2026-05-20T12:53:29.099880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"bab13a00-8388-4b3a-bda8-a2b8bd36a4be","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:4b8b8440a9d123bc6920719559d9eee64543e741b686c6b1ab32b459aa758f77","observation_id":"1d4a99c3-927b-4551-9858-c4bfcd7bd42e","resolution":{"observed_at":"2026-05-20T12:53:29.126223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:7ca97e5a185e681d4365ad968b0a472b1583406571fe1e139b3b29b8b4415ed0","observation_id":"d674d6fd-e408-4bb7-be12-5ca75bf7f1b0","resolution":{"observed_at":"2026-05-20T12:53:17.687925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenVLA: An open- source vision-language-action model","venue":null,"work_id":"768ae433-b492-416c-9b3e-89878e062399","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:448961d7102f30d3f2e61d393a9718a246b7a4dd3260eb4bf661a8cd6421bfbe","observation_id":"51a453dd-e221-4464-96f1-2f1c90c42aff","resolution":{"observed_at":"2026-05-20T12:53:29.179140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:c30a5b7d7f5e37f5d81ad70792c798653b5f8dc47b4746637ea8d171f9032c31","observation_id":"9cc0998f-da3c-4191-a37a-803b40ec33a8","resolution":{"observed_at":"2026-05-20T12:53:17.726188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:56:37.617412Z","title":"Vla-jepa: Enhancing vision-language-action model with latent world model","venue":null,"work_id":"32706181-717a-461d-87e8-271938e76e0b","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:055bfb8d0013437cbb9f4b7db9e616a728c6fcf67cdba99389486210994b6714","observation_id":"8b8f72f0-26ba-44ad-b8d8-8c8d7b61e4ff","resolution":{"observed_at":"2026-05-20T12:53:17.730425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconvla: Reconstructive vision- language-action model as effective robot perceiver","venue":null,"work_id":"81af7c29-3de8-4d9e-a0a0-ae8018583368","year":2026},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:d9f95f7d0c87d38012380f28bf5b588b9640301f03528c0489e788f534671572","observation_id":"59133584-fb53-4ed5-aca1-1e0ad34bd7db","resolution":{"observed_at":"2026-05-20T12:53:29.177442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial forcing: Implicit spatial representation alignment for vision-language-action model","venue":null,"work_id":"c1d57d32-bc04-4f69-b1d4-c07323cca227","year":2026},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:3afc28eb6467a260f41b63976c29b2c6e30d12c01c818f1ac1d00bb50cf20ac8","observation_id":"432e511c-7e91-4b79-ab64-d558f7ca87dd","resolution":{"observed_at":"2026-05-20T12:53:29.201587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-affordance: Affordances are versatile intermediate representations for robot manipulation","venue":null,"work_id":"fe482535-972b-4135-8626-11ec1a4ecfd7","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:7e367642a111966a6c96414764ee0994200bb381575b1a7442d336869ec49b8a","observation_id":"6ab08b49-dd82-4e33-bc51-c421305ab70a","resolution":{"observed_at":"2026-05-20T12:53:29.184320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moka: Open-world robotic manipulation through mark-based visual prompting","venue":null,"work_id":"4b036e79-5c97-42d8-bd8e-a24cbca14298","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:f350cc785e6156138ca08f3fafd2179ade1402f7ddc3e772a4c08fa2e65ba369","observation_id":"0145e820-13d5-4025-9184-55029ff32c71","resolution":{"observed_at":"2026-05-20T12:53:29.211213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge enhanced bottom-up affordance grounding for robotic interaction","venue":null,"work_id":"ff69f0a7-4ca9-4d9e-bf95-ea14d59ce1f2","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:d66a380e48d5e446692ba4597ac3a9807dd559c93b29a6caa6fe2178028d0595","observation_id":"8e10241c-45ca-45e2-bd69-8b179736809d","resolution":{"observed_at":"2026-05-20T12:53:29.209407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uncertainty-aware state space transformer for egocentric 3d hand trajectory forecasting","venue":null,"work_id":"d19626e5-6d24-493e-9465-da1c522c4252","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:27b551831212e6fe8810896060ef750284f416e73eaeade374986adf0c96ef05","observation_id":"815ad580-1760-4fd9-83fc-2e4cd411505c","resolution":{"observed_at":"2026-05-20T12:53:29.190574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.10672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:50.491353Z","title":"arXiv preprint arXiv:2507.10672 , year=","venue":null,"work_id":"50ad5e19-0d60-4bb4-b3fc-01ecdee5d7a4","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:50c0634bd15f687cafde548a1ea6712bbf0613b89e769512e3b952a862bae0a2","observation_id":"a79f06d0-d910-4c5b-a070-bbb73373db87","resolution":{"observed_at":"2026-05-20T12:53:17.707386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coa-vla: Improving vision-language- action models via visual-text chain-of-affordance","venue":null,"work_id":"f6924471-597b-47d3-8ba8-ca418704aab5","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:920bc411cbb1d67a9d9a64914bbf5219b6318cd19e01b6103a872951ba029ae6","observation_id":"f2c43b1b-1d17-4e03-ab93-cb4bbc6077ac","resolution":{"observed_at":"2026-05-20T12:53:29.186883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-08T17:47:58.330839Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2601.07060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.07060","snapshot_observed_at":"2026-07-04T04:09:35.401252Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","venue":"cs.RO","work_id":"7659e222-fa94-430e-b904-f1a599203247","year":2026},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2601.07060","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:35ce5fbffb219a62a8b4360a13c4e66062b28e679cc8b7065cfe5edfd8d7a7ec","observation_id":"3982747b-e186-4606-bb30-e8756490d2de","resolution":{"observed_at":"2026-05-20T12:53:17.710898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:6edc30fa2d2cebea8461ab0b2791f2317e9a49d6b46bc2e2d6e5f1ee7aaf2a7c","observation_id":"127fac3d-d8a6-4695-bb87-d8394e089365","resolution":{"observed_at":"2026-05-20T12:53:17.693960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:28d98121627f9017041bf5407e4d08ed182702afa7a8c65dafb6ff81ff7b3a15","observation_id":"26c62ed2-df55-4b25-a3e6-da110d70e524","resolution":{"observed_at":"2026-05-20T12:53:17.703792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:7a5d8ead471c1ea71672d09fcff9c809c059925ce15d508536c9202ac4857524","observation_id":"20807dcc-7c92-4e2d-88d1-eff5233743a0","resolution":{"observed_at":"2026-05-20T12:53:17.700714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collab- oration 0","venue":null,"work_id":"d2d78d56-857b-4d72-bb12-d7c114980909","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:cf4a5edb994e0984fbc6bf6d9d4b94745944fc98022c37b9433284046b02eb2b","observation_id":"213ba8ba-50af-4292-a7bf-99076b11954b","resolution":{"observed_at":"2026-05-20T12:53:29.180900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":"456367de-bfb1-4886-b2b4-ad03232fe701","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:946e495ca8e623633a69c94032016fa0a10d45780556905d80ebfdc8aff264e0","observation_id":"a56228ed-2ed6-4908-a8be-bd4e9c9ad57b","resolution":{"observed_at":"2026-05-20T12:53:29.185019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01166","last_updated":"2026-05-08T03:58:29Z","snapshot_observed_at":"2026-07-06T22:44:00.266269Z","submitted_at":"2026-02-01T11:34:37Z","title":"Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2602.01166","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.01166","snapshot_observed_at":"2026-07-09T05:36:01.180602Z","title":"Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models","venue":"cs.RO","work_id":"6e132164-e81e-47c1-a2b0-0abae63e122f","year":2026},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2602.01166","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:d70b99c746e74f8b0113fafea967c0c85e772e7cab386f64de411f4188abc0b2","observation_id":"2c17658d-5a34-4d27-9ddc-7639f6b5566d","resolution":{"observed_at":"2026-05-20T12:53:17.718213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":"2509.06951","doi":"10.48550/arxiv.2509.06951","metadata_source":"pith","pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","venue":"cs.RO","work_id":"0557ae67-ef52-4cba-a579-208458bc2bbc","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:5b0a8a011a4162ca45bfd6b2df76519701ab76438c7171606ff01958c2499d41","observation_id":"e9335216-3146-4cdf-b019-fae644691dcc","resolution":{"observed_at":"2026-05-20T12:53:17.714061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":"2511.14759","doi":"10.15607/rss.2025.xxi.128","metadata_source":"pith","pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","venue":"cs.LG","work_id":"7c1b3355-694a-44c6-880f-631e897e1713","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:84f52c0fa7251611ef2184aca7866061426ed1d1b769bc387782a196f245fc87","observation_id":"bbf4e9fb-371b-497c-bc86-212e66694060","resolution":{"observed_at":"2026-05-20T12:53:17.733969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.20715","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.697034Z","title":"Ig-rft: An interaction-guided rl framework for vla models in long-horizon robotic manipulation","venue":null,"work_id":"b991720c-4733-4a38-b161-ca9600ccec87","year":2026},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:52506a83808d595d7886c70a4d273e4a6d34db4c901f1e297c452a7b185e42b0","observation_id":"d5bc91fc-6de5-4798-8560-472502e8c796","resolution":{"observed_at":"2026-05-20T12:53:17.722182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.18719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-07-10T23:07:47.932038Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","venue":"cs.RO","work_id":"7bc1dc16-0cc4-4159-8dd5-180b59579c5e","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:35bdceba32142d6043ead210e08f28a53b9750f9192cb6b608f4fb4e1458c78d","observation_id":"d7845171-13e2-4158-8031-77b30695902b","resolution":{"observed_at":"2026-05-20T12:53:17.670684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The ecological approach to visual perception","venue":null,"work_id":"ef0392d2-aaf1-481f-bded-3dc1398de305","year":1977},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:056e998961ddbd6cdc6871ea35818aff5edd87ae04ab8d82452bfc4d0e217fc7","observation_id":"fa1698af-058c-4e4e-b48d-d132b2766042","resolution":{"observed_at":"2026-05-20T12:53:29.196842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Affpose: An integrated rgb-based framework for simultaneous pose estimation and affordance detection in robotic tool manipulation","venue":null,"work_id":"66762b67-6193-46f3-a682-fc6f34d644fc","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:0b5405b64a8cf28d472c56605ba0ccb04d895df6e9e628239486e25e95834786","observation_id":"2c3ef289-13ec-48d2-8d79-ba01854eafb5","resolution":{"observed_at":"2026-05-20T12:53:29.205791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Affordancellm: Grounding affordance from vision language models","venue":null,"work_id":"4a6bd179-eb2d-40ca-bc5f-98cf765e4089","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:bf9d1112f0bdd24c447c5580b6e42d82f9ba30da2b5884f70607dc62b591008a","observation_id":"3da84687-8238-4a0c-8335-f4f2978a242b","resolution":{"observed_at":"2026-05-20T12:53:29.188007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object affordance detection with relationship-aware network","venue":null,"work_id":"fe439579-ee2b-4f99-9f66-762bf6475c60","year":2020},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:1788200d64ac87cab3e663cf64a21f328d91ddf69bc9d9adc1791cfd6f9bfc85","observation_id":"85a8b5fd-b186-4dc2-8111-4528b4494520","resolution":{"observed_at":"2026-05-20T12:53:29.124475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12124","last_updated":"2025-08-31T00:47:29Z","snapshot_observed_at":"2026-07-06T19:34:14.633116Z","submitted_at":"2024-10-15T23:57:35Z","title":"Learning from 10 Demos: Generalisable and Sample-Efficient Policy Learning with Oriented Affordance Frames","version":2},"cited_work":{"arxiv_id":"2410.12124","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12124","snapshot_observed_at":"2026-06-29T17:23:45.208452Z","title":"Affordance-centric policy learning: Sample efficient and generalisable robot policy learning using affordance-centric task frames","venue":null,"work_id":"0ea6624e-d1c6-4a03-a226-f7091043b921","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2410.12124","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:2ddf0c6d52a22923c898226aa2d1d737c19de2c0034fbcf8306c8fda240f3a36","observation_id":"9f478216-4223-4a9d-a180-b49e0cfbf81f","resolution":{"observed_at":"2026-05-20T12:53:17.677492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Closed-loop visuomotor control with generative expectation for robotic manipulation","venue":null,"work_id":"4ad92018-5e8c-427a-ae86-ecbb914f4fee","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:b8131dd0f6ceef10e064e249e3c2905c2454ee75f5bda59792dcd84c4112c4c6","observation_id":"2b143792-06fc-4c29-8e2b-d5ebde73bc9a","resolution":{"observed_at":"2026-05-20T12:53:29.128088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manipgpt: Is affordance segmentation by large vision models enough for articulated object manipulation?","venue":null,"work_id":"7aa7ba06-700d-497d-a0d2-54e9ca380405","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:9a23111afcb5b4afdb49bab2d5b42f588f51935cb4f9257df32992dd8ba859a8","observation_id":"ffcaae19-44c8-42cb-a209-fc4839c0b3fb","resolution":{"observed_at":"2026-05-20T12:53:29.162449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":"2203.12601","doi":"10.48550/arxiv.2203.12601","metadata_source":"pith","pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","venue":"cs.RO","work_id":"1fb6c1b7-913d-4a89-bbad-842fdb5fca1d","year":2022},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:897d5366f4dcbcdafca9a3bdeb0a9483c18834e1f744ed78d2fc1749ccc30092","observation_id":"a9d2855f-7075-44ec-a710-dec7d8234f71","resolution":{"observed_at":"2026-05-20T12:53:17.681129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":"97bc0382-7b2a-455a-b570-12271e463be4","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:279dfc78ee857508a255507e2afa237e81149b841558fb0e706c42d5a08bfaa3","observation_id":"a8dec64e-d821-4735-8a8f-b8f966d90d00","resolution":{"observed_at":"2026-05-20T12:53:29.174158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3drs: Mllms need 3d-aware representation supervision for scene understanding","venue":null,"work_id":"5fde41b2-2dd3-4883-8663-faa6ad1bfef6","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:9d593e027d2487633656834e8245a4e4524ce6ec2f3174f3a60017cfcc09a8bc","observation_id":"d1ac1003-d649-41a2-9ecc-b93ef8b26e84","resolution":{"observed_at":"2026-05-20T12:53:29.176092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Genhancer: Imperfect generative models are secretly strong vision-centric enhancers","venue":null,"work_id":"65d9a134-4414-4d09-aba4-92038ad6d727","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:a655d5220311e7c5370164407648de6eee1c7d9e5ea5de416bfbb82cae2f0b42","observation_id":"59b041a6-3c7c-4314-a72a-cfb099456f91","resolution":{"observed_at":"2026-05-20T12:53:29.180032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":"16caf5b6-7b91-48ce-838e-de20b2d78114","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:1873952ec3b4e1ac96b109721be4732ed3ebd77e24282e446b238f5632d5c458","observation_id":"fb5616a3-2328-4a7a-acd4-b85ec585c9b6","resolution":{"observed_at":"2026-05-20T12:53:29.194834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-modality alignment perception and multi- head self-attention mechanism for vision-language-action of humanoid robot","venue":null,"work_id":"226f755d-b0f9-47f4-ab2b-ded9d5c46090","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:bda20ee3d1cf4305699fd93d020539e57862a5c6854e0c30aa408357235dad5f","observation_id":"f977aa6c-3148-43c6-97a9-1613c5ab54f6","resolution":{"observed_at":"2026-05-20T12:53:29.198939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatialvla: Exploring spatial repre- sentations for visual-language-action model","venue":null,"work_id":"b085099a-b1ba-433d-81e9-35e57de232df","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:569267aff21553124cf79afaa4c53f7d20ef42cedbd317ad85bf3ade4ac96db5","observation_id":"8e927c4a-c817-4a2b-b8bc-c4ac2c54e454","resolution":{"observed_at":"2026-05-20T12:53:29.155405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15659","last_updated":"2025-05-21T15:33:27Z","snapshot_observed_at":"2026-08-10T09:12:51.490663Z","submitted_at":"2025-05-21T15:33:27Z","title":"FLARE: Robot Learning with Implicit World Modeling","version":1},"cited_work":{"arxiv_id":"2505.15659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15659","snapshot_observed_at":"2026-07-10T12:47:05.520966Z","title":"FLARE: Robot Learning with Implicit World Modeling","venue":"cs.RO","work_id":"0734908a-7122-4eeb-ba5d-944092bb8897","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2505.15659","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:98e4a5eac317dddf7a3b3d1a125fd4a0e5d6fd5933c3f43488378e75d14fc421","observation_id":"55e7d085-89c9-49ce-9ebb-491aa79a0eb2","resolution":{"observed_at":"2026-05-20T12:53:17.697262Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow matching for generative modeling","venue":null,"work_id":"b27a5302-fc0a-4336-9374-35f73b18feeb","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:7a36c9992ad5150a9bcfd61e7e9a6cf2a981c98eb9513855a17c4491c7256a70","observation_id":"46538472-d2c3-4216-bdca-8c6c7ef2b353","resolution":{"observed_at":"2026-05-20T12:53:29.151907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SAM 3: Segment anything with concepts","venue":null,"work_id":"3a528f37-73d5-4b0d-8a74-30fd7605063d","year":2026},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:b0bae3e45ba466fd5761a32ec9fe459a4425904fcf31b41aa0e8b9495d40f815","observation_id":"b153f260-a7f7-4d0a-869a-ac83214b19bb","resolution":{"observed_at":"2026-05-20T12:53:29.152167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deciphering cross-modal alignment in large vision- language models via modality integration rate","venue":null,"work_id":"c1f972e6-c62e-4d84-b87f-62c88f50de58","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:71d8e83ab92d5c76e8378c58feb365afde30d8a832aada80c6cb218ae3120b57","observation_id":"7367755f-ca11-4dd2-bc85-63e443071924","resolution":{"observed_at":"2026-05-20T12:53:29.158038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning affordance grounding from exocentric images","venue":null,"work_id":"f571ebec-963e-41b0-8103-cf8ea2c6cc47","year":2022},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:ff9def16db4e5a7a67b75829785f05aade213dee4b97002b92401b3cf7ad8f7a","observation_id":"fedddaaf-862b-4a52-a075-5ab7b42bc6b9","resolution":{"observed_at":"2026-05-20T12:53:29.166985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Locate: Localize and transfer object parts for weakly supervised affordance grounding","venue":null,"work_id":"65196ea1-461c-42e1-b968-a07d27f451ed","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:8660a7337f4842eacdfdabac2712b23bcb4f67bde35a924d70e3f05844a65039","observation_id":"288c51a2-fa5f-4550-85fd-fd26ce3b5db5","resolution":{"observed_at":"2026-05-20T12:53:29.172268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What do different evaluation metrics tell us about saliency models?","venue":null,"work_id":"2c4023ec-846f-4e67-b648-43b7bb1f3401","year":2018},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:4048a55da3ea46b4c08f5da250095f3dd9d4013b70f1184f7428d3ee137932d0","observation_id":"5dc70278-2283-42ba-a76a-6d4c015f3619","resolution":{"observed_at":"2026-05-20T12:53:29.207556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Color indexing","venue":null,"work_id":"7e3cab8d-63e3-41b7-b77b-5ef279ae4c56","year":1991},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:3bfe38940c7825fcb5007894381cd331c63151fecff8361e84a31268d77aa61e","observation_id":"2d48d88a-0444-4c07-a334-145e7b4af50a","resolution":{"observed_at":"2026-05-20T12:53:29.170013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Components of bottom-up gaze allocation in natural images","venue":null,"work_id":"4eaa42a4-65a6-4c11-83d6-4ad67b256e94","year":2005},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:1f150ff26e6a8deb6548e9a31ee699c79f1c90567555b2f028ea43ff862963f7","observation_id":"bb2a4a6d-75c0-469f-a7b4-980e48f40ccc","resolution":{"observed_at":"2026-05-20T12:53:29.164145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding 3d object interaction from a single image","venue":null,"work_id":"0116a7e8-f5b8-4fa1-992c-4ce5ec563d70","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:0b3d5433bcb5c74762a32f4b286c90d4e0d426839aec6697adbb5729b6dc6228","observation_id":"9ad4f51e-eddb-41d4-99c8-d6813c24b5cc","resolution":{"observed_at":"2026-05-20T12:53:29.195716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-shot open affordance learning with foundation models","venue":null,"work_id":"b048172a-8304-4aaf-819d-647a3233eb80","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:df20e2eff426901f8028f20a4bed2b1dcb01a03d4f737612cbc9f1566f719da2","observation_id":"10841c49-fa8b-461a-8d98-cba3d08ef548","resolution":{"observed_at":"2026-05-20T12:53:29.192756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15650","last_updated":"2026-07-10T15:14:57Z","snapshot_observed_at":"2026-08-09T09:32:07.417236Z","submitted_at":"2025-04-22T07:16:56Z","title":"AffordanceSAM: Segment Anything Once More in Affordance Grounding","version":3},"cited_work":{"arxiv_id":"2504.15650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15650","snapshot_observed_at":"2026-07-13T01:20:01.599725Z","title":"Affordancesam: Segment anything once more in affordance grounding.arXiv preprint arXiv:2504.15650","venue":null,"work_id":"d3f96a23-69ad-443b-b3fb-1df396d36590","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2504.15650","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:7a31b6bb51ff14ff2e885ce98e897c2eb0fe3ba132f5f465e365badc717ffba5","observation_id":"03e23903-42be-4165-b5d9-b49c85e3ec21","resolution":{"observed_at":"2026-07-13T01:20:01.599725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded human- object interaction hotspots from video","venue":null,"work_id":"306011a6-4d3e-483c-beeb-310bfc6a71b5","year":2019},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:16ae1e17b397acd564b96ab566f21527d2057db4c9151d9591489ca3749e6465","observation_id":"95f9dfb1-24a1-40d7-b1d6-7928772f05ab","resolution":{"observed_at":"2026-05-20T12:53:29.142475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intra: Interaction relationship-aware weakly supervised affordance grounding","venue":null,"work_id":"e792d48a-8bff-46aa-a66e-6133fe9ee3fc","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:58fcfd2002ce1328c9e583c938a6a57dbd01ff516062da085a9dfb674078f768","observation_id":"da60d217-8234-45df-a374-5b2e104f4b55","resolution":{"observed_at":"2026-05-20T12:53:29.203639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resource-efficient affordance grounding with com- plementary depth and semantic prompts","venue":null,"work_id":"1bba77ed-4e03-42d7-a057-2823b197db73","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:2ae937a999720f6e8d92f1bf9606fbd425ccc31913cf51a03b2dad6022cd1484","observation_id":"14467bd2-8949-4af2-87a9-f7d9651dc935","resolution":{"observed_at":"2026-05-20T12:53:29.139099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"40cab6cd-08a4-42d7-b0aa-1c0c8e049d22","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:7de645f9e84186f41bba562b29883ac932dad12268fcd7b7bdadf118b9b40f88","observation_id":"444c3b59-7f1c-4494-a816-434a279fd112","resolution":{"observed_at":"2026-05-20T12:53:29.142970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MMR: A large-scale benchmark dataset for multi-target and multi-granularity reasoning segmentation","venue":null,"work_id":"ea6cf6d5-a25f-4679-b4a0-4f7e9d6441f8","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:07ab6e7cc72c91f9009a64c689d98876c6b65843e894d5be3d46e1aa8dc2d89e","observation_id":"d2900695-e64b-4ed3-be2a-fd3b5ecda3bc","resolution":{"observed_at":"2026-05-20T12:53:29.146825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12009","last_updated":"2026-07-01T05:17:36Z","snapshot_observed_at":"2026-08-07T00:55:59.889392Z","submitted_at":"2025-06-13T17:57:18Z","title":"Affogato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale","version":2},"cited_work":{"arxiv_id":"2506.12009","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12009","snapshot_observed_at":"2026-07-02T02:17:13.047323Z","title":"Affogato: Learning open-vocabulary affordance grounding with automated data generation at scale.arXiv preprint arXiv:2506.12009","venue":null,"work_id":"d8f3daaa-46cd-449e-8446-286e96684022","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2506.12009","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:b8bf6d05400b4a6efbbfde747bc9fc93970a22ae704bd4c3d927df6f5470dd29","observation_id":"a12663a9-6238-44a9-b0ad-96e20f6dc542","resolution":{"observed_at":"2026-07-02T02:17:13.047323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:1f2ef5cb00424bb0829e8aa4b4f3f1d992f4d6b58c8849310ac06608adcf547f","observation_id":"d2ee9b20-a786-49d4-b477-149a7b6c18e4","resolution":{"observed_at":"2026-05-20T12:53:17.684753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware","venue":null,"work_id":"36ccbaf1-0fc8-4c58-ad64-8cb4af494616","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:456a42b945fb9d394235ea5f9c223e84f0ad64ddcc731db0a0b008a10f959450","observation_id":"281fbaa8-e280-4702-9c90-90d952b320c6","resolution":{"observed_at":"2026-05-20T12:53:29.144895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"0f5ed070-d2cf-4b7c-a597-6b0d68e71fd2","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:85ddcab42a4c15d23639bad19f7b77ddf159dacd06bcb4edd0d1c92098837beb","observation_id":"cfbbd6f9-3a5d-4464-a8a2-b9d83e5a26c4","resolution":{"observed_at":"2026-05-20T12:53:29.125435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":"d83e9525-d516-49ce-bfe2-b3e6a4ef4ebe","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:063f148c9ff835220804f432945a37baaa50610008823b7457433336bbcb4ad3","observation_id":"397de45f-204b-4998-8c52-20277e796062","resolution":{"observed_at":"2026-05-20T12:53:29.136913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RDT-1b: a diffusion foundation model for bimanual manipulation","venue":null,"work_id":"00ea05f5-255b-4fb5-abf5-c03fef368468","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:9078e59fd32299353fd3ef75e02cfe531d4bcc1010a165e4207849f825f1d014","observation_id":"45ab4b1e-79b5-4b88-8693-366b49c3da5d","resolution":{"observed_at":"2026-05-20T12:53:29.140760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-shot transfer of affordance regions? affcorrs!","venue":null,"work_id":"c6e65428-687c-498b-952a-dc92bf91048e","year":2023},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:21e4a65819981d15b47edf7df307e91327d1312e381f4c4de2f643d91bf10b3a","observation_id":"93351783-2e91-4a60-81d5-39cb3fb18aea","resolution":{"observed_at":"2026-05-20T12:53:29.146298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weakly supervised multimodal affordance grounding for egocentric images","venue":null,"work_id":"01d6c9d7-b339-40d1-b46e-f62017eceb83","year":2024},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:44fdc6097c72ba5980bb29de32d25d1eb3ec70203ea91481dc0940c2966f8693","observation_id":"f73198b2-c764-435c-ba7a-3a9773eff58b","resolution":{"observed_at":"2026-05-20T12:53:29.133498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weakly-supervised affordance grounding guided by part-level semantic priors","venue":null,"work_id":"66ae9d6d-b434-4a27-8b2e-20186254a1df","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:e4f217fa0689b34556cc81b519db693d999171629acefba5d3db6b7cfcec92a6","observation_id":"18133da4-1426-44f0-8c0b-3e2c8ed6f92e","resolution":{"observed_at":"2026-05-20T12:53:29.135126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning mamba: Hypergraph-guided region relation calculating for weakly su- pervised affordance grounding","venue":null,"work_id":"26737599-ef12-425c-8e5c-b9d2d7b336f6","year":2025},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:80adf4987e5dedf39a9c5256acb7381574affc92561bb9dce4734e75c3116493","observation_id":"309184ed-5d07-4737-9b7b-7cfd51332b42","resolution":{"observed_at":"2026-05-20T12:53:29.148311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:42:52.455374Z","title":"Visualizing data using t-sne","venue":null,"work_id":"372ae24b-daf9-46ce-88a3-07c58966d0e6","year":2008},"citing_paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T12:49:02.418663Z"},"links":{"citing_paper":"/paper/2605.17517"},"observation_digest":"sha256:f653f465aa3ab1de6b986abb89955e8ccd1784814796b35af782c00654b83488","observation_id":"7051b13f-ea93-4d3f-80a3-dbeba47f1486","resolution":{"observed_at":"2026-05-20T12:53:29.170395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17517","last_updated":"2026-05-17T16:02:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T23:28:30.942078Z","submitted_at":"2026-05-17T16:02:05Z","title":"AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":58},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2605.17517."}