{"as_of":"2026-08-05T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:809fc753f889f98afe87c6265ffad5912df0c27b4759f21a65d0b893bfa88101","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T17:39:23.051951Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:29:06.207663Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18662","snapshot_observed_at":"2026-08-02T03:29:06.207663Z","title":"M2r2: Multimodal robotic representation for temporal action segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13882","last_updated":"2026-07-15T14:31:26Z","snapshot_observed_at":"2026-08-02T03:29:01.315473Z","submitted_at":"2026-07-15T14:31:26Z","title":"Learning Forward & Reverse Skills from a Single Unfinished Demonstration for Constrained Manipulation Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T03:29:06.207663Z"},"links":{"cited_paper":"/paper/2504.18662","citing_paper":"/paper/2607.13882"},"observation_digest":"sha256:c25c77f12dee98665ded75c9251c964c0724df536ff60f00014c0d265e05a254","observation_id":"b9e930da-b1fa-4622-be2d-8a7b1353e845","resolution":{"observed_at":"2026-08-02T03:29:06.207663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.18662/citation-record","integrity":"/paper/2504.18662/integrity","json":"/paper/2504.18662/citation-record.json","paper":"/paper/2504.18662"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Waypoint-based imitation learning for robotic manipulation","venue":null,"work_id":"6273998d-0384-4885-a164-bb4158ff3684","year":2023},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:9dc9481e9033a17e402bdd43486abb21f1e3c124328c82c70e8054bdc4cbbd94","observation_id":"ac687d64-dcbc-4de2-af20-c55803a091ca","resolution":{"observed_at":"2026-05-22T17:41:54.277341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditionnet: Learning preconditions and effects for execution monitoring","venue":null,"work_id":"ece0959f-ae4b-4044-8433-84e558606d80","year":2024},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:4a601de54e1aadad283fc8c0f40f2d17a535c94728c72fac079d59306e501d88","observation_id":"c3c215ac-acc4-4eb2-b740-cb685db73deb","resolution":{"observed_at":"2026-05-22T17:41:54.273848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal action segmentation: An analysis of modern techniques","venue":null,"work_id":"1ee151d8-5c0a-4bcd-9fe6-e7540a95a5de","year":2024},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:2d95d567e7f1434e84274550abd969a828a3bee294dc52fb9dfd1c8f642723e1","observation_id":"57d4b70e-5cd8-4ccd-b61b-61628b5a4102","resolution":{"observed_at":"2026-05-22T17:41:54.270362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised human motion segmentation based on characteristic force signals of contact events","venue":null,"work_id":"9848fe74-bed7-4aec-8abe-eeb45810a927","year":2023},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:3523680da63f935879d723383a3a7ca68240b201734103e5dbf81ddb1037a74a","observation_id":"15714c13-1d33-471e-b67c-ee90fbcb1ac2","resolution":{"observed_at":"2026-05-22T17:41:54.267060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online task segmentation by merging symbolic and data-driven skill recognition during kinesthetic teaching","venue":null,"work_id":"7b7ddf86-538f-4b4c-a48a-c04d3e7b4e0c","year":2023},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:d585e3d2bd273f4f832ffc48c95a60da68108383b47386c4b9f8b267d08ef5f8","observation_id":"b9bec5e0-00e2-47f4-a717-268520da3f24","resolution":{"observed_at":"2026-05-22T17:41:54.263638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movement segmentation using a primitive library","venue":null,"work_id":"eeefef80-7e92-46c2-afc1-e3130325d70f","year":2011},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:54b7c8717ef4c047891d7432efd658f3742d976f30c3fbfb7d7cccf19d398071","observation_id":"4ab1cfeb-dcc7-4413-b941-f7a80f8b88e3","resolution":{"observed_at":"2026-05-22T17:41:54.256881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gesture recognition in robotic surgery: A review","venue":null,"work_id":"24f47be9-b29c-44f9-85da-8738f3147cf9","year":2021},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:d7c8b87137ed6c432f14b0a0190acdfe077fd9c9b87e1f11bf87cfab4e5044ed","observation_id":"ba088ce4-837a-4e84-a9bf-0a91afe9aff3","resolution":{"observed_at":"2026-05-22T17:41:54.253338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ms-tcn: Multi-stage temporal convolutional network for action segmentation","venue":null,"work_id":"acdda043-89d2-4020-a148-9cc042e2fb48","year":2019},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:2e3539e3a4bb4b4fc91255a7934ad656b281d1b8d875a502ac9208e287f5004b","observation_id":"1d9d18e5-1892-46b2-a331-58dc22e02b19","resolution":{"observed_at":"2026-05-22T17:41:54.249631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aspnet: Action segmentation with shared-private representation of multiple data sources","venue":null,"work_id":"a46c778d-c985-48f6-89c4-a91265818c43","year":2023},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:f68bd48f049fd42987b4b760bf8e9dc822c6e8f4dfee46e9d7df13d56c8b65f0","observation_id":"363b519c-fe79-4a76-bb41-819e5c8720a7","resolution":{"observed_at":"2026-05-22T17:41:54.246166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alleviating over- segmentation errors by detecting action boundaries","venue":null,"work_id":"ece4ae67-03f7-4f04-af20-623a3d90218b","year":2021},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:2df73a7d7c79ad7c646bcf850a97f87b5e308f48f9adca45100c5e5b6846ca6d","observation_id":"5390e222-eed7-4a65-97bf-2d5a5e436702","resolution":{"observed_at":"2026-05-22T17:41:54.241997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion action segmentation","venue":null,"work_id":"b087c427-a981-437a-a5ed-86c4ae63c042","year":2023},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:5259f146e65f155c90cf9a70f35b0f16c811120a10af558bf6602d03b29b9b6e","observation_id":"f02716c0-dea3-48ed-b516-36a66cf8e4fa","resolution":{"observed_at":"2026-05-22T17:41:54.238110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"4623d3cf-7f72-4506-8de7-bb4991f10ada","year":2017},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:df49e627311150bf78dbb323e311b960fc8fee8dad75116c5b3ac5fef1ea99a5","observation_id":"705138af-57b6-41ae-8672-5b944b61672e","resolution":{"observed_at":"2026-05-22T17:41:54.230778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05086","last_updated":"2025-04-28T07:22:45Z","snapshot_observed_at":"2026-07-06T20:32:57.499716Z","submitted_at":"2025-02-07T17:03:57Z","title":"REASSEMBLE: A Multimodal Dataset for Contact-rich Robotic Assembly and Disassembly","version":2},"cited_work":{"arxiv_id":"2502.05086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05086","snapshot_observed_at":"2026-07-03T15:28:34.771549Z","title":"Reassemble: A multimodal dataset for contact-rich robotic assembly and disassembly","venue":null,"work_id":"c917eca4-b4f4-4b0a-a464-3f18e20a7f43","year":2025},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"cited_paper":"/paper/2502.05086","citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:1658ec2c8d2de895a7aa8ed89466843597b47ea554f72aa0cc88cf540791c86b","observation_id":"e2d1ecf0-fb9c-4e1f-b5a2-ffb5ac0542ec","resolution":{"observed_at":"2026-05-22T17:41:53.092837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2017.502","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T10:57:05.404949Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"a3554377-7042-4e90-9605-a28cedbdd994","year":2017},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:82886d05a0dc96479032175bd581a4deb67a762eee241769c89b20a64c1868df","observation_id":"911c523c-d602-4153-af85-f3d3e988e765","resolution":{"observed_at":"2026-05-22T17:41:53.003804Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:30.270612+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:30.270612+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":"2109.08472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-07-04T20:00:08.259998Z","title":"Action- CLIP: A New Paradigm for Video Action Recognition","venue":null,"work_id":"e4022c4a-1a07-4760-a40b-9728fd25cdd4","year":2021},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:3076a5da8667d44fc3f143ef859043d2c4de57b67a0e6df00d5a51cd6e6e765a","observation_id":"64738afd-5232-4775-aa1e-ca4dfe9670b1","resolution":{"observed_at":"2026-05-22T17:41:53.079251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridge-prompt: Towards ordinal action understanding in instructional videos","venue":null,"work_id":"c69dce2a-99d7-4ef9-a444-85dc13eb8674","year":2022},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:0dae802d59ae5e70854200e72c1106a652f49f071de0c068d8d18c460bf54a99","observation_id":"69142f46-84d5-448e-aa34-de5ed6ff2ef5","resolution":{"observed_at":"2026-05-22T17:41:54.260286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refining action segmentation with hierarchical video representations","venue":null,"work_id":"cb8d4d76-5660-4949-b7ae-9938e3c270c4","year":2021},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:b335b92c11211d724a808a6c0c2b741659dc135efd6fe4d472bb81007c13b83c","observation_id":"fd9cf97f-39bf-4d6a-8f9f-abcd2151ade1","resolution":{"observed_at":"2026-05-22T17:41:54.227328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segmental spatiotemporal cnns for fine-grained ac- tion segmentation","venue":null,"work_id":"670a6c14-39cf-4f49-9c16-04a8150db5ce","year":2016},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:30ab7a4e04abc3f6b687dc27c46541151c8546415b48a174e00ba2db8ed83432","observation_id":"8b222591-4a63-4f7a-a72d-06ccbfa997f9","resolution":{"observed_at":"2026-05-22T17:41:54.224001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recognition and prediction of surgical gestures and trajectories using transformer models in robot- assisted surgery","venue":null,"work_id":"1d780480-ad51-4cfe-b7c2-4cf4c4071cc1","year":2022},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:be883108523ee2000bdc87455d124c9d05bd24efdcf9d02a7a427e8b79d9c46b","observation_id":"bc26ed7f-e277-48ae-87d0-b086b5111700","resolution":{"observed_at":"2026-05-22T17:41:54.220602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal transformers for real-time surgi- cal activity prediction","venue":null,"work_id":"36785dca-2dff-4a18-ac08-cf759fad9800","year":2024},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:e70af36327af296e7f1b0498b00d91f001aa7753f123f924461eed0473a07f44","observation_id":"dd8248a9-ae94-400a-872f-07474dc55f94","resolution":{"observed_at":"2026-05-22T17:41:54.217716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-03T23:00:35.904734Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":"2104.01778","doi":"10.48550/arxiv.2104.01778","metadata_source":"pith","pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Ast: Audio spectrogram transformer","venue":"cs.SD","work_id":"b697ee73-6e22-4cba-84d1-4a1dab594872","year":2021},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:d6ec2109f67e31d229d48af4e3b22ba072bbb7a7d3440b4aede17e59ceb4995b","observation_id":"d15fcc3d-a5ac-40e7-ad52-82e7c5442a09","resolution":{"observed_at":"2026-05-22T17:41:53.072562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T18:20:56.483183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transition state clustering: Unsupervised surgical trajectory segmentation for robot learning","venue":null,"work_id":"43c1e0a8-1d84-47bb-88e2-d585c0df5a7b","year":2017},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:f2a1bd4702a9131bd2449ca7f40b97649cea2f514980c393614ccc1c99d4e1a9","observation_id":"edd81d41-4f2d-4ff8-9f3c-e4940d130a5a","resolution":{"observed_at":"2026-05-22T17:41:54.208715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Discovering action primitive granu- larity from human motion for human-robot collaboration","venue":null,"work_id":"07abcf2c-10cf-44fa-bdf0-269ae09ef259","year":2017},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:33b225a9340e3f64566fdecfdf74e7c2c92d59ec2260de1b3e9e146caf9642f4","observation_id":"d1f2d5ae-f730-4ca7-9eca-fa651ed7230c","resolution":{"observed_at":"2026-05-22T17:41:54.214599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03858","last_updated":"2022-12-08T05:52:16Z","snapshot_observed_at":"2026-07-31T16:11:29.403033Z","submitted_at":"2022-12-07T18:55:53Z","title":"See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2212.03858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.03858","snapshot_observed_at":"2026-07-02T13:46:59.729691Z","title":"See, hear, and feel: Smart sensory fusion for robotic manipulation","venue":null,"work_id":"e9e67c63-5390-4cf4-b26a-1306bfbb147d","year":2022},"citing_paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:23.051951Z"},"links":{"cited_paper":"/paper/2212.03858","citing_paper":"/paper/2504.18662"},"observation_digest":"sha256:cccace99f88df68e241fcfb6d4370939dc1811316e0c30104802651544330510","observation_id":"f895161f-596a-4592-97e7-26e1fe02d573","resolution":{"observed_at":"2026-05-22T17:41:53.086128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18662","last_updated":"2026-04-29T08:31:04Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T21:14:57.707919Z","submitted_at":"2025-04-25T19:36:17Z","title":"M2R2: MultiModal Robotic Representation for Temporal Action Segmentation"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":19},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2504.18662."}