{"as_of":"2026-08-08T06:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4da9a669bb0f60c9f76067e2cc540ca893ad6a9f376ec06d81685a199e57e65","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:17:44.617418Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26567/citation-record","integrity":"/paper/2607.26567/integrity","json":"/paper/2607.26567/citation-record.json","paper":"/paper/2607.26567"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:40.804168Z","title":"A survey of multimodal perception methods for human–robot interaction in social environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:40.804168Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:066687e329b49e6eed4715d2e94de1f72a812d50023b81ae49db79534ad154fe","observation_id":"e5875476-9fa7-4af1-acc7-d3fe0b640670","resolution":{"observed_at":"2026-08-01T13:17:40.804168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10807","last_updated":"2026-06-22T19:43:20Z","snapshot_observed_at":"2026-07-06T17:04:17.738921Z","submitted_at":"2023-12-17T20:13:20Z","title":"Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10807","snapshot_observed_at":"2026-08-01T13:17:40.868587Z","title":"Bridging language and action: A survey of language-conditioned robot manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:40.868587Z"},"links":{"cited_paper":"/paper/2312.10807","citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:59bd8e663aada968167832fa933d4bc1482406c500f19f7c6e0cfcf2df777c8b","observation_id":"baa4904a-65ae-4779-905e-e6f3959b9059","resolution":{"observed_at":"2026-08-01T13:17:40.868587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:40.940075Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:40.940075Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:f571779296690b95b8092caf82d50de7fb2c79f7ac4e2150c4064d3ab1643475","observation_id":"99c503f5-d8b1-4513-b62e-5d0d6d719fc1","resolution":{"observed_at":"2026-08-01T13:17:40.940075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:41.036434Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:41.036434Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:1604ad13229f15d66739a21546475dae0da00865f008528a59e17535f9f752a9","observation_id":"96c490f4-3dcd-42f9-9dfe-e6e76ddb70e6","resolution":{"observed_at":"2026-08-01T13:17:41.036434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:41.163678Z","title":"Onellm: One framework to align all modalities with language,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:41.163678Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:334dc4af0cccbfb08fe9fa056bba46bbd40bf15765318396d9e354139f7f9659","observation_id":"5d00cfb0-d6ae-4f02-bc96-b7cd8ca73e19","resolution":{"observed_at":"2026-08-01T13:17:41.163678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:41.324446Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:41.324446Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:81e0e52642c8b3dc8dd5e5c7166177ecaf1aff4d4eed902a22de2db4dd3b0790","observation_id":"72fb525c-c191-47d5-897a-de29a64688ad","resolution":{"observed_at":"2026-08-01T13:17:41.324446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:41.462012Z","title":"SSR: Alignment-aware modality connector for speech language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:41.462012Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:5d76d857ab4e97589edad013a043105feeea04ce60876577ba32f6ba3e3fa120","observation_id":"d49e5acd-7dbc-450c-a30f-add42862b6a3","resolution":{"observed_at":"2026-08-01T13:17:41.462012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:41.618540Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:41.618540Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:b18e53386ad29d43b3730d7b776b3d1887766e7eefc99aa2687bbc842fe3b4d8","observation_id":"22f4565c-bea8-476e-b9f5-06c698829cc6","resolution":{"observed_at":"2026-08-01T13:17:41.618540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:41.726710Z","title":"Align before fuse: vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:41.726710Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:a80541a788781da15c94c68552cbc53c3591e1000ce37d82816b59bffae53ed3","observation_id":"0f7a617c-616e-4e65-ab59-67ff4967813b","resolution":{"observed_at":"2026-08-01T13:17:41.726710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:41.916765Z","title":"Grasp-anything: Large-scale grasp dataset from foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:41.916765Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:da1120554c5b4d899190a8897457da19b2dfaf8bd80c40ec9c924606ebd15727","observation_id":"12000793-9115-4466-bb74-a5f1d81500f5","resolution":{"observed_at":"2026-08-01T13:17:41.916765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.070636Z","title":"Adaptive knowledge distillation between text and speech pre-trained models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.070636Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:0524b74f1cb59eea017ef07ab29dddd0dbf85bd33339f3c1657d27b217cadbbd","observation_id":"3ca6102a-d65c-41ab-a628-c9f5f55e9c00","resolution":{"observed_at":"2026-08-01T13:17:42.070636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.195512Z","title":"Afd-slu: Adaptive feature distillation for spoken language understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.195512Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:264b962a60603dd1f77adc69d0bb28bc0dc8cece3a12a128710cd793436fbd4e","observation_id":"6d2a3d25-fca9-4439-96a7-57f744711bd4","resolution":{"observed_at":"2026-08-01T13:17:42.195512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.283338Z","title":"Smaller and faster robotic grasp detection model via knowledge distillation and unequal feature encoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.283338Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:4135fc439e854c34b22e4fa830e8257591f030a704dddc7d4778bf80e1ad0242","observation_id":"2eecf0b8-6e0a-467d-a337-a3cd1246fb74","resolution":{"observed_at":"2026-08-01T13:17:42.283338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.354288Z","title":"Lite- grasp: A light robotic grasp detection via semi-supervised knowledge distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.354288Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:03548b34e4bb8953d04956bd0981df2f1581d9d0239786ffb0eae831d1009b8d","observation_id":"cdd0b589-c82d-4557-9dd1-5aa41c07c9f4","resolution":{"observed_at":"2026-08-01T13:17:42.354288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.436459Z","title":"Pdcnet: A lightweight and efficient robotic grasp detection framework via partial convolution and knowledge distillation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.436459Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:4ecb9f20fc1b16c3365ea66683c4e5f7711b639c35cd312cb23895aadb4af1b4","observation_id":"a74cefa3-aa23-447f-b474-52dd3f95c986","resolution":{"observed_at":"2026-08-01T13:17:42.436459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.508175Z","title":"Language-driven grasp detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.508175Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:60aa3c0c2507eff06e9ed1416a01b04fa897e36cfb65b12097d4935f1e3fe928","observation_id":"acc8adce-1bc7-4363-a8a6-191ae555ec75","resolution":{"observed_at":"2026-08-01T13:17:42.508175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.636894Z","title":"Graspsam: When segment anything model meets grasp detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.636894Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:5c8c166b3657f2004d1fb0f722b538a1f3408ad998a972355bdaa1cbd3267acc","observation_id":"437f4cf0-dc9d-455d-9949-e055d5bc2b14","resolution":{"observed_at":"2026-08-01T13:17:42.636894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-01T13:17:42.726671Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.726671Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:20ba7ce97c84bd6d041cde36185b6ad0d53a1c9a1c574e38b5e6d0be42860e87","observation_id":"730c76dc-e84f-4180-88e7-55cf3806d833","resolution":{"observed_at":"2026-08-01T13:17:42.726671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.817185Z","title":"Language-driven 6-dof grasp detection using negative prompt guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.817185Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:9b085a89fa400161b3e7bc59c84bd0d64d40c20b7e5a19c42904608fcbc8dfac","observation_id":"04e9dde6-6c5b-407b-b65b-12b1a742c093","resolution":{"observed_at":"2026-08-01T13:17:42.817185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.867606Z","title":"Kittentts: State-of-the-art lightweight text-to-speech model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.867606Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:3a3b5d7668e8318f6776035b50bbf7b2b6625800ba1dde1de1f06b43d05c28a3","observation_id":"8c398470-d1e3-4620-875b-ccc655060ab7","resolution":{"observed_at":"2026-08-01T13:17:42.867606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:42.947640Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:42.947640Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:8ded1b42da3ce8be9dee26ec451203573c62455230fd1989dabd4250d161f15e","observation_id":"41953d25-fe60-4b6e-a875-320258b86170","resolution":{"observed_at":"2026-08-01T13:17:42.947640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.009977Z","title":"Visualizing data using t-SNE,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.009977Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:37671b48c7232148dcc22e91aa691ddcc7e52f3fdcdc561acccff7bde9d738dc","observation_id":"38dd5461-9c48-4847-9605-2a064c776d39","resolution":{"observed_at":"2026-08-01T13:17:43.009977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.116063Z","title":"A study on data augmentation of reverberant speech for robust speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.116063Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:7e74cdf2b6d263212c3acb10ce9504966d5e5d4525c9df812f1892c27f53e9da","observation_id":"2fedfb61-e2f3-46b0-a379-5149939ad852","resolution":{"observed_at":"2026-08-01T13:17:43.116063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.192802Z","title":"Jurafsky and J","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.192802Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:00c14af1d9724f7e6fa40e3b0f22119e923f3435536d3ad797d46d850f35a1b1","observation_id":"c3ec92d1-f4b7-4701-9eb9-19aeb65f8bae","resolution":{"observed_at":"2026-08-01T13:17:43.192802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.279133Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.279133Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:171c47f097abfee66aecd3a9feaea5c7a33eecf6b1f8f52da084603484d4b43e","observation_id":"5822b8ad-7e97-45da-91f3-be97a500527c","resolution":{"observed_at":"2026-08-01T13:17:43.279133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12637","last_updated":"2025-08-09T09:39:15Z","snapshot_observed_at":"2026-08-05T14:41:29.001238Z","submitted_at":"2025-01-22T04:53:12Z","title":"DWTNeRF: Boosting Few-shot Neural Radiance Fields via Discrete Wavelet Transform","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12637","snapshot_observed_at":"2026-08-01T13:17:43.367421Z","title":"Dwtnerf: Boosting few-shot neural radiance fields via discrete wavelet transform,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.367421Z"},"links":{"cited_paper":"/paper/2501.12637","citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:c5c80aa8d16c838986850beee45896d050a83f85672e10da7e8412c5982a8ddf","observation_id":"26acc669-6577-4e57-acbf-b2615429cdee","resolution":{"observed_at":"2026-08-01T13:17:43.367421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.419284Z","title":"Dwtgs: Rethinking frequency regularization for sparse-view 3d gaussian splatting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.419284Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:0a21a78cf96ac9902e8c7050b04f4da1329104ba97859684d9bd195ed7003bee","observation_id":"cd4e0d9c-1b13-48ad-b4a2-d2bfd22894a8","resolution":{"observed_at":"2026-08-01T13:17:43.419284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.464852Z","title":"From coarse to fine: Learnable discrete wavelet transforms for efficient 3d gaussian splatting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.464852Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:6526e81331a09d6b416d5de0396377d0ba7573af1b071898dcabe6bf3bca841b","observation_id":"9eb5b573-8c2d-46d9-be69-ef70b36ef9e8","resolution":{"observed_at":"2026-08-01T13:17:43.464852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.513693Z","title":"Waveletgaussian: Wavelet- domain diffusion for sparse-view 3d gaussian object reconstruction,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.513693Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:c70db69012e2ff59e075cc9f45688eb87860ffe90928b210605a12fa4bba2c25","observation_id":"4f220038-afde-4cda-b2bc-594e68e3a55c","resolution":{"observed_at":"2026-08-01T13:17:43.513693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.592869Z","title":"Learnable multi-level discrete wavelet transforms for 3d gaussian splatting frequency modulation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.592869Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:e3caf886c9a00346384b5b9f93630a87b8f704e4c371d64d67ca64fb109e8827","observation_id":"c6e85b9b-90e0-497a-9d8d-57470b96a5c9","resolution":{"observed_at":"2026-08-01T13:17:43.592869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.878517Z","title":"Wavelet diffusion models are fast and scalable image generators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.878517Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:8e96fd6be750b992efd034002ffe346a8e5107b7d613d36459a54d29314fa94c","observation_id":"c2b92c81-0b13-4253-94a0-7755b95a1888","resolution":{"observed_at":"2026-08-01T13:17:43.878517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:43.995351Z","title":"Lvis: A dataset for large vocabulary instance segmentation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.995351Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:0f56cbf277ad624b0fc93af240609f8c55df3607c09db699719827154ab3226d","observation_id":"2da84aa2-3f57-4011-bf54-ff0b5ce6f0dd","resolution":{"observed_at":"2026-08-01T13:17:43.995351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:44.162167Z","title":"Conditional prompt learning for vision-language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:44.162167Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:85e14a001b0a54ef62bd4552a73684ed8e8bbba10d91e416717fdb883a3f2bf4","observation_id":"0cc5dbd2-0ee0-49eb-9abd-ba900c8f6aba","resolution":{"observed_at":"2026-08-01T13:17:44.162167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:44.321738Z","title":"Liteasr: Efficient automatic speech recognition with low-rank approximation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:44.321738Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:ffa6b8aebdc168fdaac496e4ba48810b4bb8ac71681b9fd966dc197a787682fe","observation_id":"ad17814c-0df6-4733-85d8-f8952e1c5a4b","resolution":{"observed_at":"2026-08-01T13:17:44.321738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:44.477877Z","title":"Pogain: Poisson-gaussian image noise modeling from paired sam- ples,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:44.477877Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:fe29dc8b7923d60efbb04c31511387e2aad72e3c688328f8122a24d872d05e4f","observation_id":"8c7d2002-f67d-4fe6-aa33-c415fb30b925","resolution":{"observed_at":"2026-08-01T13:17:44.477877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:17:44.617418Z","title":"Unitree robotics official website,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:44.617418Z"},"links":{"citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:496930b7195be57c69d90aeaf4240d88d523ea18ab72e79f93553ae2e407db0f","observation_id":"64b4ca17-9975-462f-8cfb-ada595ecaeb5","resolution":{"observed_at":"2026-08-01T13:17:44.617418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14199","last_updated":"2026-05-12T02:47:08Z","snapshot_observed_at":"2026-07-06T22:45:58.457005Z","submitted_at":"2026-02-15T15:49:03Z","title":"Learnable Multi-level Discrete Wavelet Transforms for 3D Gaussian Splatting Frequency Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.14199","snapshot_observed_at":"2026-08-01T13:17:43.754901Z","title":"Available: https://arxiv.org/abs/2602.14199","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T13:17:43.754901Z"},"links":{"cited_paper":"/paper/2602.14199","citing_paper":"/paper/2607.26567"},"observation_digest":"sha256:af001a9d9b4b580af049c18c35e46552af06e3c9c8c740ec79b6ec0e52bc6b47","observation_id":"203d4363-c9d3-4436-80e9-5c054b0ea8ae","resolution":{"observed_at":"2026-08-01T13:17:43.754901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26567","last_updated":"2026-07-29T07:40:00Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T10:39:24.584008Z","submitted_at":"2026-07-29T07:40:00Z","title":"Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.26567."}