{"as_of":"2026-08-14T15:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2307d72c4cccb8929d223adaefcad7298940b368e9bcf097b942d197f71f7cc7","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:28:01.619301Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14675/citation-record","integrity":"/paper/2607.14675/integrity","json":"/paper/2607.14675/citation-record.json","paper":"/paper/2607.14675"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:54.965088Z","title":"You Only Look Once: Unified, Real- Time Object Detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:54.965088Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:b978430a4f1152929cff220ce2d29866f76f6eb80f371c469843aa8b6545b06e","observation_id":"d2ce58ce-6303-49e0-b331-15fa5d0c434c","resolution":{"observed_at":"2026-08-02T01:27:54.965088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:55.106710Z","title":"YOLO9000: Better, Faster, Stronger,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:55.106710Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:407a2732cf9377c9eaca7b9ef86c7e124f646a0d35780df647f8f8ae19b8a868","observation_id":"0206d837-1c8c-4fa5-b818-a84b87fb1d35","resolution":{"observed_at":"2026-08-02T01:27:55.106710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-06T11:09:16.409556Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-02T01:27:55.249830Z","title":"YOLOv3: An Incremental Improvement,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:55.249830Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:bec46de9453c309ba2ba3ec3a7d620de3dea51b7d7e342fe00f932bb34ccea96","observation_id":"a487f2e2-b5d7-48bb-a547-648a6e9f1e2d","resolution":{"observed_at":"2026-08-02T01:27:55.249830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10934","last_updated":"2020-04-23T02:10:02Z","snapshot_observed_at":"2026-07-06T09:14:32.318388Z","submitted_at":"2020-04-23T02:10:02Z","title":"YOLOv4: Optimal Speed and Accuracy of Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10934","snapshot_observed_at":"2026-08-02T01:27:55.366748Z","title":"YOLOv4: Optimal Speed and Accuracy of Object Detection,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:55.366748Z"},"links":{"cited_paper":"/paper/2004.10934","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:0d43e14b1669338cda999c9b4377c80f1acaa5f251ac9f3fbaa17664b271b3c3","observation_id":"c89d9af4-6478-493d-9f79-e71424803a66","resolution":{"observed_at":"2026-08-02T01:27:55.366748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02976","last_updated":"2022-09-07T07:47:58Z","snapshot_observed_at":"2026-08-13T14:31:50.103878Z","submitted_at":"2022-09-07T07:47:58Z","title":"YOLOv6: A Single-Stage Object Detection Framework for Industrial Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.02976","snapshot_observed_at":"2026-08-02T01:27:55.468740Z","title":"YOLOv6: A Single-Stage Object Detection Framework for Industrial Applica- tions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:55.468740Z"},"links":{"cited_paper":"/paper/2209.02976","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:caf920cc2388807755061d4ffcab50ebd77cc10c0fcf57ec934333c0c98d5fcb","observation_id":"2b00bf5b-0d3b-409d-b137-cd77950ab7c4","resolution":{"observed_at":"2026-08-02T01:27:55.468740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:55.595785Z","title":"YOLOv7: Trainable Bag-of-Freebies Sets New State-of-the-Art for Real-Time Object Detectors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:55.595785Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:ba79ca9c6e1e2abca3c567188addd5b846943f4d11a22fd0edf012c2ba329907","observation_id":"407bc2a0-34e8-4795-bef0-bfa14a1643c7","resolution":{"observed_at":"2026-08-02T01:27:55.595785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13616","last_updated":"2024-02-29T03:43:24Z","snapshot_observed_at":"2026-08-13T04:13:54.945776Z","submitted_at":"2024-02-21T08:42:53Z","title":"YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13616","snapshot_observed_at":"2026-08-02T01:27:55.698686Z","title":"YOLOv9: Learning What You Want to Learn Using Programmable Gradient Information,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:55.698686Z"},"links":{"cited_paper":"/paper/2402.13616","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:f502c237dc63ac5ec7c850cfb62d6c32d158ce262921a66628c3f99ac454f237","observation_id":"6a9d5fba-216c-41b1-8a52-62069ad65662","resolution":{"observed_at":"2026-08-02T01:27:55.698686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14458","last_updated":"2024-10-30T01:49:34Z","snapshot_observed_at":"2026-08-12T23:59:58.018406Z","submitted_at":"2024-05-23T11:44:29Z","title":"YOLOv10: Real-Time End-to-End Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14458","snapshot_observed_at":"2026-08-02T01:27:55.781407Z","title":"YOLOv10: Real-Time End-to-End Object Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:55.781407Z"},"links":{"cited_paper":"/paper/2405.14458","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:1425741063dbda2a883db3e52a5875797299cd9218372fd90c31d49b68611aa2","observation_id":"cd4ba6c9-1851-4e57-8835-62513c752426","resolution":{"observed_at":"2026-08-02T01:27:55.781407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:55.929803Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:55.929803Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:4aeb0d9439ec6e3fbccdfb11c9779e6fcd56d4884fe24225f50a99295c08d00d","observation_id":"a77f38f0-843c-4166-98c5-342bf9827cda","resolution":{"observed_at":"2026-08-02T01:27:55.929803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:56.089146Z","title":"SSD: Single Shot MultiBox Detector,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:56.089146Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:7e23ad3d184d4d7c144e89575f46d18133a4899fef768e6babf23d9fa30b2859","observation_id":"76d9d287-dd28-4a99-b21d-680bdcffcd2b","resolution":{"observed_at":"2026-08-02T01:27:56.089146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:56.263469Z","title":"Focal Loss for Dense Object Detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:56.263469Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:37f656fda933111c30559044302c48642d76ac802227d69dae30f45a1ee6a182","observation_id":"d260c4ba-b770-41a1-bcb5-d4f08cda10b4","resolution":{"observed_at":"2026-08-02T01:27:56.263469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:56.402511Z","title":"End-to-End Object Detection with Transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:56.402511Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:eda0eb0f785091fa4882a476d50c2f906c4bd05686b1db8c1d56f0f1392747b5","observation_id":"2dac9ae9-56de-4b5a-a5e8-5b89281a07c9","resolution":{"observed_at":"2026-08-02T01:27:56.402511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:56.550576Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detec- tion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:56.550576Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:1c20c0db0ad801e5d923dab93c6ab9d9e9d9e99b5e1ebf456606547e77451bd0","observation_id":"68422a9d-4ffa-4f37-9279-f61b9b32d2cf","resolution":{"observed_at":"2026-08-02T01:27:56.550576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:56.671701Z","title":"Mask R-CNN,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:56.671701Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:b305432ea14bd86dde6c09218a5ede92c7ead4b759fef9807ed24b36589b0c52","observation_id":"8cfe396d-30ac-4cf7-af10-16442898df59","resolution":{"observed_at":"2026-08-02T01:27:56.671701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:56.826527Z","title":"CBAM: Convolutional Block Attention Module,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:56.826527Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:47faa2c574ce38576e11fb65215558a85da6a9ad1cf47852e3cac818e72b3b0d","observation_id":"b8c01bb8-a2b2-4453-8fc9-d3554e66e97b","resolution":{"observed_at":"2026-08-02T01:27:56.826527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:56.942471Z","title":"Squeeze-and-Excitation Networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:56.942471Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:a2d171df4f9dc957d5a8fa061d69d309f86c84da8090c1faa1b8f7eb82254e99","observation_id":"98139c05-7f86-4599-b1c6-a5b9fa4a6700","resolution":{"observed_at":"2026-08-02T01:27:56.942471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.040193Z","title":"Attention Is All You Need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.040193Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:ea486d68b169093f248e702372fad94340a453ce91bee6507d6b96c3b4a1fe28","observation_id":"a1165607-0ed8-4580-817a-495fdec6f434","resolution":{"observed_at":"2026-08-02T01:27:57.040193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.157890Z","title":"Non-Local Neural Networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.157890Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:556abf000880320050251a979fa54aae9d63f92b935c97a21d6dfd435920f6ae","observation_id":"55301acf-0213-451a-ac3f-9d29dc05aaa4","resolution":{"observed_at":"2026-08-02T01:27:57.157890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.235872Z","title":"Coordinate Attention for Efficient Mobile Network Design,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.235872Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:bb2e49e5309d656fdea5d7aec97f7db74d0000fe72264488fde2c15974daea03","observation_id":"6a4c3653-b680-40f5-bfe9-02fdb960c4c4","resolution":{"observed_at":"2026-08-02T01:27:57.235872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.316228Z","title":"Generalized Intersection over Union: A Metric and a Loss for Bounding Box Regression,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.316228Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:51d3b9227c4004f1d04d168c4601126c6ca2b0b0028840f05507276dd1e784bd","observation_id":"7ea68dd5-6f07-404e-99d2-98b9f96d7af7","resolution":{"observed_at":"2026-08-02T01:27:57.316228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.382839Z","title":"Distance-IoU Loss: Faster and Better Learning for Bounding Box Regression,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.382839Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:74a2c266648c4e8218c65bd02b6898bdd1b3216bcd2429d818004125ac85260a","observation_id":"0ab16a1d-43af-4054-ac52-f0bf57dd9940","resolution":{"observed_at":"2026-08-02T01:27:57.382839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12740","last_updated":"2022-05-25T12:46:21Z","snapshot_observed_at":"2026-08-13T15:37:19.071259Z","submitted_at":"2022-05-25T12:46:21Z","title":"SIoU Loss: More Powerful Learning for Bounding Box Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12740","snapshot_observed_at":"2026-08-02T01:27:57.440376Z","title":"SIoU Loss: More Powerful Learning for Bounding Box Regression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.440376Z"},"links":{"cited_paper":"/paper/2205.12740","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:33a6a7285067c0e1b024c978496db3cca4d345be78e048ddafa6fc471e8260db","observation_id":"a9f037dc-066a-4ed6-8f47-40540d7f5c77","resolution":{"observed_at":"2026-08-02T01:27:57.440376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.505845Z","title":"Focaler-IoU: More Focused Intersection over Union Loss,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.505845Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:b6de8195b06304984a020b6a636aad7472f938aa497cab9637396f38773758c5","observation_id":"dbda39a1-d9b3-42f8-ba47-9e2cc9d94e94","resolution":{"observed_at":"2026-08-02T01:27:57.505845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.575970Z","title":"UnitBox: An Advanced Object Detection Network,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.575970Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:b9604f104be9c25abeadbef9b51bc69f0448ab8cebd1dacac00529c3ff294515","observation_id":"793f9ed5-c70d-4ad6-9b2f-77b75a5bbe64","resolution":{"observed_at":"2026-08-02T01:27:57.575970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.649886Z","title":"Language Models Are Few-Shot Learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.649886Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:0c1e886a4cb30983ccf301e3d0075ea045eafc809fc13a130d44f4d8930a13d0","observation_id":"d3599dbc-274c-4dd4-8d32-b9c8091d3d91","resolution":{"observed_at":"2026-08-02T01:27:57.649886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T01:27:57.731195Z","title":"LLaMA: Open and Efficient Foundation Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.731195Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:114abf38890f6e94982682ab7b64885aadd981ecf86a7d301d78aa6a2df287fd","observation_id":"12d0812a-1545-452a-ad37-2fb9689e2c93","resolution":{"observed_at":"2026-08-02T01:27:57.731195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T01:27:57.813669Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.813669Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:510ec9e6b54d833ef62741a3c4e37cda38a2616eed9d1d3d0a868d732bae4597","observation_id":"2cb89733-8871-4351-b369-3d2eec495057","resolution":{"observed_at":"2026-08-02T01:27:57.813669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-02T01:27:57.898391Z","title":"GPT-4 Technical Report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.898391Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:a8a4d31d6e725978aba75ac9e04fb4ccdf6c3fb15fa4f6a51aa9f2652819e3df","observation_id":"f540a740-09be-4290-aa15-15b567122c12","resolution":{"observed_at":"2026-08-02T01:27:57.898391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:57.978487Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:57.978487Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:fa4be38b93cc8f718da2ac4866cde1da7bf3bd130524884703f9ceb3d80eda85","observation_id":"d4659746-3ce0-44cc-8266-f5ccbefbdade","resolution":{"observed_at":"2026-08-02T01:27:57.978487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-02T01:27:58.065543Z","title":"PaLM: Scaling Language Modeling with Pathways,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.065543Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:74e795999955b919ba618ebc96461e54041852a0502da3ddd5ac76bccf8c4734","observation_id":"2acdb142-bac2-4f57-b7c9-b4dad7c1115d","resolution":{"observed_at":"2026-08-02T01:27:58.065543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:58.150328Z","title":"LearningTransferableVisualModelsfromNaturalLanguageSupervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.150328Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:ce7f308fd008b209c151f7e128d9a3518781a8348d3fd080f7e45f89deacf919","observation_id":"cf795011-e53c-40fc-adbf-7c1e059732ec","resolution":{"observed_at":"2026-08-02T01:27:58.150328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:58.161162Z","title":"BLIP: Bootstrapping Language-Image Pre-Training for Unified Vision-Language Understanding and Generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.161162Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:dd5cb77a41183c3789b5f2edae007d7caf70bedb80e713f89b94a67725d93d49","observation_id":"c72cb270-fe74-4077-84f8-c42a3af9c2ad","resolution":{"observed_at":"2026-08-02T01:27:58.161162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:58.299457Z","title":"BLIP-2: Bootstrapping Language-Image Pre-Training with Frozen Image Encoders and Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.299457Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:e7168df5d59facc0b9ce5793e227887bb956a7d73f5327ebbd8f864be9d17d2c","observation_id":"ad04f198-185a-4e8a-8bdd-43d308cc2fb8","resolution":{"observed_at":"2026-08-02T01:27:58.299457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:58.336581Z","title":"Visual Instruction Tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.336581Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:06a0615252eabda36a67ab97dfb08b32b30cf7867de0be0862961fb141cef71d","observation_id":"f6c4cb4b-82d9-45f3-bd8c-53863d05ebf1","resolution":{"observed_at":"2026-08-02T01:27:58.336581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-02T01:27:58.446531Z","title":"Improved Baselines with Visual Instruction Tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.446531Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:586e05cc2194b043983051018b2e291725bdebfa98d1698838587fb9e4db651d","observation_id":"af88eb50-f6c2-4e5f-b046-ce4594eab5ca","resolution":{"observed_at":"2026-08-02T01:27:58.446531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:58.552364Z","title":"Flamingo: A Visual Language Model for Few-Shot Learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.552364Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:b5a8dc0a90846b09daf7de410e1d0621f2904bb158c694f05de213756793a2ed","observation_id":"ddd7f4f1-911f-4956-ac4b-906c8af9e190","resolution":{"observed_at":"2026-08-02T01:27:58.552364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-02T01:27:58.680234Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.680234Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:be7ba030efc94a55b60ce67157af2c0bab0f347a8a2f7318055e888c98343958","observation_id":"0b6953cf-7bac-4e9a-a63c-84bfe5177377","resolution":{"observed_at":"2026-08-02T01:27:58.680234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:58.794645Z","title":"AnImageIsWorth16 ×16Words: TransformersforImageRecognition at Scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.794645Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:73fd8561ae5492224cc192a45688e27ec600a6acd1bc99cd265d621e1d0df9fb","observation_id":"12d98d6d-6fea-4685-8478-e7d6cab107b1","resolution":{"observed_at":"2026-08-02T01:27:58.794645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:58.904736Z","title":"Masked Autoencoders Are Scalable Vision Learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:58.904736Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:06c63c4299f1a696f8396790e7b22f040e0b457b3a1aea953adcd4fee1ac447c","observation_id":"f32b98a4-57e7-41ca-a205-f4e25e6c45d2","resolution":{"observed_at":"2026-08-02T01:27:58.904736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:59.041232Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:59.041232Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:ab816ebce23169f38eac1b6eee7dc3d026867981cf57f10f70013b2dbc3f879a","observation_id":"6ad2960d-2457-449c-bcb1-05c0c9c928cc","resolution":{"observed_at":"2026-08-02T01:27:59.041232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:59.207004Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:59.207004Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:4feb1f909aeb1c53659da168a6e41dd115d45274548d26f08cafbb505ba65a78","observation_id":"97fe3b86-7c0b-41be-9b84-54018a558a9b","resolution":{"observed_at":"2026-08-02T01:27:59.207004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:59.373066Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:59.373066Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:c15f6fec2fd807ad69f9aeb7a24ebb6412873468a01fe74061ba0452202d66ca","observation_id":"d42dd1ed-68d4-4df6-8588-42e44d6d2b8f","resolution":{"observed_at":"2026-08-02T01:27:59.373066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:59.492385Z","title":"CLIPort: What and Where Pathways for Robotic Manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:59.492385Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:ad2989fd275eec385f0465ab49109ae3bc408aca731906e64fb2d7b82da7d22c","observation_id":"fa5bc69e-1a46-41d5-881d-effeae353d2a","resolution":{"observed_at":"2026-08-02T01:27:59.492385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:59.638626Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:59.638626Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:033f1b0caa6c2ebaaa3ceef2d4980ed9159cb828983620778ad59fcb2c2e8bae","observation_id":"dd8244b5-e65f-4d3b-b105-97a1f3eb9d82","resolution":{"observed_at":"2026-08-02T01:27:59.638626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:59.804962Z","title":"Generative Agents: Interactive Simulacra of Human Behavior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:59.804962Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:a398ccc52683beb98e472a1cf0b8fb22b16efec1e02b1ef119be9f6dde4a1b3d","observation_id":"d871c382-15c8-42c0-bcd2-c9f7e2f615d2","resolution":{"observed_at":"2026-08-02T01:27:59.804962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:27:59.970912Z","title":"Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T01:27:59.970912Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:d6dabbc367a38d22418f060a96a91e54b78baf1442f424fb637c909aae871f95","observation_id":"41ae76cf-4d39-4d0e-8a41-4fe04d1ea2e7","resolution":{"observed_at":"2026-08-02T01:27:59.970912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:00.131308Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:00.131308Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:e0550eb3eef92028867f49b4b22d6d756545dc5019cfce5c1772e51e9ed9f80f","observation_id":"2c7cf377-d878-4898-9ca5-f2ecd97c45e0","resolution":{"observed_at":"2026-08-02T01:28:00.131308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:00.239227Z","title":"Deep Residual Learning for Image Recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:00.239227Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:ce961fef6510a046fc7335c51f907bd71717a81229c76e0ce81a223d37d9fd11","observation_id":"e15cf791-f9dc-499e-9dc7-3755f6664649","resolution":{"observed_at":"2026-08-02T01:28:00.239227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:00.397659Z","title":"MobileNetV2: Inverted Residuals and Linear Bottlenecks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:00.397659Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:f0b890359726047a9229edfadc2bb2365fab15c83f71a2ce3bcdfcf5129e161d","observation_id":"83d1710c-361b-4c41-8bf2-eb3b87186448","resolution":{"observed_at":"2026-08-02T01:28:00.397659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:00.564351Z","title":"Searching for MobileNetV3,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:00.564351Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:d25e07396a6523c3e9aa10286ec478433d12cadd72cce1f5f3b964df7c92f654","observation_id":"0cbca189-8953-4ecb-8706-e7719ed4ca05","resolution":{"observed_at":"2026-08-02T01:28:00.564351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:00.731294Z","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:00.731294Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:7e180cf21aa559c65f05ee39e3a1d7b3221513b48e59ef875fa542793559f8de","observation_id":"80647a6e-89a9-4ad6-a465-ba8ed57febbb","resolution":{"observed_at":"2026-08-02T01:28:00.731294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:00.892238Z","title":"Edge AI: On-Demand Accelerating Deep Neural Network Inference via Edge Computing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:00.892238Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:6b1dc1c910f409c6ea4cb061ad79755d4e30a42a106d2026a8b400b7ded3292b","observation_id":"8b0b7568-45b0-47da-b0fc-96b32c6b1cda","resolution":{"observed_at":"2026-08-02T01:28:00.892238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:01.004357Z","title":"MLPerf Tiny Benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.004357Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:2e2c9b4511feaf6e9ef9b7636887d1007608246aaba94ff749dea9875d1b0ea8","observation_id":"e50a6a68-e2df-4860-b409-3727791d5e46","resolution":{"observed_at":"2026-08-02T01:28:01.004357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:01.083960Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.083960Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:327e5d91c2f403148ff9e08b4f1f83145b28e48ffebff083f457c11c55185e60","observation_id":"1920287e-6f0b-45cf-898c-e0dce011808d","resolution":{"observed_at":"2026-08-02T01:28:01.083960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:01.176513Z","title":"Rethinking the Inception Architecture for Computer Vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.176513Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:25ac30584bcb7fb28adb37c27c5d04bbb19c17864687736f87051c56a3bcafb5","observation_id":"8be47a5c-48d2-4fc2-b1f5-eb5735cdb833","resolution":{"observed_at":"2026-08-02T01:28:01.176513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:01.256440Z","title":"DINOv2: Learning Robust Visual Features without Supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.256440Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:e05e393817c439c45a381ad58e67d0c8ba1c7e19cb9ff903c1108d6f7e246e89","observation_id":"055f7727-9abc-4f90-b64f-43f36f599023","resolution":{"observed_at":"2026-08-02T01:28:01.256440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:01.340115Z","title":"Penetration Testing for System Security: Methods and Practical Approaches,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.340115Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:30637aa0ebec6bc0a53b5b54d1e353faa79e566689e47da0e0714004abd7d82f","observation_id":"ec84c30b-501a-48fd-bf88-8f4599bdfc9a","resolution":{"observed_at":"2026-08-02T01:28:01.340115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:01.423115Z","title":"SmartBugBert: BERT-Enhanced Vulnerability Detection for Smart Contract Bytecode,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.423115Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:02e7fec9e24e0fd417b397ba43635aa78c0f681971622eddd6ee35156a7fa031","observation_id":"87472f62-df8d-44c9-bfb8-ab1b9a1ae142","resolution":{"observed_at":"2026-08-02T01:28:01.423115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07419","last_updated":"2025-04-10T03:25:20Z","snapshot_observed_at":"2026-08-07T16:06:59.548965Z","submitted_at":"2025-04-10T03:25:20Z","title":"Exploring Vulnerabilities and Concerns in Solana Smart Contracts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07419","snapshot_observed_at":"2026-08-02T01:28:01.429733Z","title":"Exploring Vulnerabilities and Concerns in Solana Smart Contracts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.429733Z"},"links":{"cited_paper":"/paper/2504.07419","citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:729d33cee38b4d8ba4cd322b82399a7b682b8a1673021524d5bed3faaef0c379","observation_id":"6902c036-1c7a-48f7-8ff1-8517ddd6e91a","resolution":{"observed_at":"2026-08-02T01:28:01.429733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:01.498143Z","title":"Interaction-aware vulnerability detection in smart contract bytecodes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.498143Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:67cb03c062a860913caf518059690db9e51160dcf1ddd45a60988580859421d9","observation_id":"90fae803-4798-4927-b9f4-6fc83e2ef225","resolution":{"observed_at":"2026-08-02T01:28:01.498143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:28:01.619301Z","title":"Penetrating the hostile: Detecting DeFi protocol exploits through cross-contract analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T01:28:01.619301Z"},"links":{"citing_paper":"/paper/2607.14675"},"observation_digest":"sha256:76e6e336f75be87c9f5b4a34a2c4c5094ce74819a12aab4e6126312904dc3165","observation_id":"2bb1dd54-0ee0-4931-ba20-987e97299127","resolution":{"observed_at":"2026-08-02T01:28:01.619301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14675","last_updated":"2026-07-23T03:08:15Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T14:01:37.293641Z","submitted_at":"2026-07-16T07:39:18Z","title":"An Intelligent-Cloud Edge Multimodal Interaction System for Robots"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2607.14675."}