{"as_of":"2026-08-14T15:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c3d188c512dde0f33c0c52827734f4acb30a8e9ca535104d158d4f8efaf493a","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:34:07.063560Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.14001/citation-record","integrity":"/paper/2509.14001/integrity","json":"/paper/2509.14001/citation-record.json","paper":"/paper/2509.14001"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:01.084750Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:01.084750Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:d5c3646c5ca5c1a63cf6b56823eae3eeabbeef094f41bc15117c28ff03d4d6b8","observation_id":"855d096e-1e39-4b2d-994f-5981407d45db","resolution":{"observed_at":"2026-08-04T16:34:01.084750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:01.173349Z","title":"Continual road-scene semantic segmen- tation via feature-aligned symmetric multi-modal network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:01.173349Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:01bda903c4641c46893970da408cd659b0b87ffa245482a70f627ab3c1b1e783","observation_id":"92f349e3-d0dd-42e3-9bf8-c5f9940ea510","resolution":{"observed_at":"2026-08-04T16:34:01.173349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:01.274757Z","title":"Cross-architecture auxiliary fea- ture space translation for efficient few-shot personalized ob- ject detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:01.274757Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:e85aa7c0815fe9569144ba78f84b69bd20beeffeabda8033ecadfa96626803d0","observation_id":"36bd31ae-e817-4c12-a11b-4ddd9a3ade56","resolution":{"observed_at":"2026-08-04T16:34:01.274757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:01.416542Z","title":"Learn- ing from mistakes: Self-regularizing hierarchical representa- tions in point cloud semantic segmentation.IEEE Transac- tions on Multimedia, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:01.416542Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:148225d2157cf73ae317b70ed27be5fb5eba28ad61155329bf30bf9ee2f0c4ca","observation_id":"7a92f379-bc57-4009-be88-31d367dda8c5","resolution":{"observed_at":"2026-08-04T16:34:01.416542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:01.564835Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:01.564835Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:bb610b7db5c3f2ced1c2828494fe30c8048c65989006ed2f6ec6c67ca591c1fd","observation_id":"08407589-1ba0-411b-880d-9373b36db6a9","resolution":{"observed_at":"2026-08-04T16:34:01.564835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T16:34:01.654751Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:01.654751Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:1dbd11586d83647df7de9431330aac88dcb2a47ee531116303c6f3d4ff3f41a2","observation_id":"a987a67e-0d61-450e-a205-ad84632159c7","resolution":{"observed_at":"2026-08-04T16:34:01.654751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:01.774763Z","title":"iCub World: Friendly Robots Help Building Good Vision Data-Sets","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:01.774763Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:3b9977d3f0ffb495fe1410c91a9ba9f3e5038b6d384484ef7cee161be0fe68f3","observation_id":"78c2c947-de4a-4ec8-be40-316972cfdb0c","resolution":{"observed_at":"2026-08-04T16:34:01.774763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:01.944748Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:01.944748Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:d7f5cfe20e7cde625eaf46a76dd973ad8abcda7cdc2d065dda697efdaedda583","observation_id":"742fb719-b393-4998-94a5-cc3c129ff94e","resolution":{"observed_at":"2026-08-04T16:34:01.944748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:02.064857Z","title":"Reciprocal teacher-student learning via forward and feedback knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:02.064857Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:02fa742884a75f95c9655396bf5569386a7085d3c603bd6117b4797e00171334","observation_id":"3e966d8e-013d-477c-b719-7cda2210a273","resolution":{"observed_at":"2026-08-04T16:34:02.064857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:02.167817Z","title":"Vild: Open-vocabulary object detection via vision and lan- guage knowledge distillation.International Conference on learning Representations (ICLR), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:02.167817Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:20094716390da3d70c279f23c1fa09815e64b4f413dbea2588bb73ddddaa7fc3","observation_id":"59d2ba31-5a42-450a-a562-2185afbda63a","resolution":{"observed_at":"2026-08-04T16:34:02.167817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:02.256557Z","title":"CDFKD-MFS: Collaborative Data-Free Knowledge Distilla- tion via Multi-Level Feature Sharing.IEEE Transactions on Multimedia, 24:4262–4274, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:02.256557Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:fe8b6fb775f85a6cbd9fc2a0e973c5e36a849122a5362ae8d7b27a905024f0fd","observation_id":"509117ab-7c1a-4a1e-a06d-4a2cabe2b21e","resolution":{"observed_at":"2026-08-04T16:34:02.256557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:02.354745Z","title":"One-for-all: Bridge the gap be- tween heterogeneous architectures in knowledge distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:02.354745Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:3f38eca8a7e0a0417f00e796dec6e1b238e3acf6295926d04f43ca2c8fc01100","observation_id":"173bcff3-867f-429c-b237-83bf2bd226b0","resolution":{"observed_at":"2026-08-04T16:34:02.354745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:02.484748Z","title":"The platonic representation hypothesis.Proceedings of Machine Learning Research (PMLR), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:02.484748Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:78c86879a4311e7e4eb6d8f424671a4386d6ad3924de61c44348d1ecf592ec6f","observation_id":"8ec161ad-6c93-407c-a659-9cb6ef48a303","resolution":{"observed_at":"2026-08-04T16:34:02.484748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:02.644748Z","title":"xmuda: Cross-modal unsu- pervised domain adaptation for 3d semantic segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:02.644748Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:374386d31d43f3953f6b6baf71ddb8e687c577624b15414820a172319abe6713","observation_id":"2a33b96f-5c4c-4dc3-b6df-cf6dc78fa11d","resolution":{"observed_at":"2026-08-04T16:34:02.644748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:02.770090Z","title":"Cross-modal learning for domain adaptation in 3d semantic segmentation.IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI), 45(2): 1533–1544, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:02.770090Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:bfc2ee1ca7345e70abcb366347f88a883d097e73bd6072e66fc7ab147ad33303","observation_id":"30b1dd86-f2a7-48c0-8841-9bdcd804b661","resolution":{"observed_at":"2026-08-04T16:34:02.770090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:02.911971Z","title":"Ultralytics yolo11, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:02.911971Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:0addf2bf55e45876dfaf7e911379cf2e246118fc77565d0b28aeae0220eb5089","observation_id":"a70a435e-513d-4f62-a9a9-e3ee08234bd6","resolution":{"observed_at":"2026-08-04T16:34:02.911971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:03.004804Z","title":"Ultralytics yolov8 [computer software]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:03.004804Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:aa66eecd3aac9b74486149e2dc1bfa21624dedbe1c406bf56f8d0b1f7407ea1a","observation_id":"da4b52e6-f4d9-40b7-995b-e19b924ffd86","resolution":{"observed_at":"2026-08-04T16:34:03.004804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:03.164260Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:03.164260Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:6097a4e115f6c454c7508b486216c3b647a5e0a22ea7cfa431cf797c67b6de86","observation_id":"895137bb-6b61-45ff-ac04-0063d1e67875","resolution":{"observed_at":"2026-08-04T16:34:03.164260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:03.364766Z","title":"Neural collapse: A review on mod- elling principles and generalization.Transactions on Machine Learning Research, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:03.364766Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:865720bbea5bf4d1b613cae36da29a36b424eb81e1aed1ef758c1f4613250d17","observation_id":"e3458ab4-6f6c-45cf-a1df-acae0abe9233","resolution":{"observed_at":"2026-08-04T16:34:03.364766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:03.574745Z","title":null,"venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:03.574745Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:68827fe8cb242ae89e57b3607344af0e5dece1a47ae200ba9ddb1a49e0bea3d2","observation_id":"6e0427b6-c275-45c4-8033-bdf7c5c356da","resolution":{"observed_at":"2026-08-04T16:34:03.574745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:03.737930Z","title":"Lightweight model pre- training via language guided knowledge distillation.IEEE Transactions on Multimedia, 26:10720–10730, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:03.737930Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:bb5cf27aa53dc4771ee9bfee0b03183afacac5968173c82334043ddb1b886c5f","observation_id":"d17aba79-f882-48cc-ad33-80f87a0c7271","resolution":{"observed_at":"2026-08-04T16:34:03.737930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:03.835737Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:03.835737Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:a5a3ca67daa7e0a5879a53f893501a6d0ef63d755d5dc641f025705eb061acbc","observation_id":"fc6b1760-a7b1-450c-95bd-21d9940dd471","resolution":{"observed_at":"2026-08-04T16:34:03.835737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:03.940477Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:03.940477Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:2778ac6cfadfa0b51421df7b1b9a2090949a44c9ddde3058f7166e2a70906733","observation_id":"f96ede73-c0f6-424d-9058-a4d3ef994a45","resolution":{"observed_at":"2026-08-04T16:34:03.940477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.043971Z","title":"Cross-architecture knowledge distillation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.043971Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:fb3ced8bcfe6f9b73d93966ad9560562f4df602682bbb28b782fa6433ced3db4","observation_id":"f7e56fad-c186-4b5a-91c8-76c130f0b387","resolution":{"observed_at":"2026-08-04T16:34:04.043971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.146765Z","title":"Matcher: Segment anything with one shot using all-purpose feature matching.International Conference on Learning Representations (ICLR), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.146765Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:e10d3470a810f1aaea87439d7ba69ac22dd326b050286bf9e317fafd51c946c7","observation_id":"8b7a5f2d-c958-482c-95d6-beabc7053226","resolution":{"observed_at":"2026-08-04T16:34:04.146765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.207976Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.207976Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:2b974265852912e89c3135bbd986126c1126b2e07c5b601adf1113a35988c798","observation_id":"c6b00503-2258-4347-be5e-44773059c261","resolution":{"observed_at":"2026-08-04T16:34:04.207976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.212824Z","title":"Core50: a new dataset and benchmark for continuous object recognition,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.212824Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:3495903c114e993f7969cb2f21776596c618ad7361294fbb44b6b91c74c86a48","observation_id":"ada1eb87-70a0-4152-a346-b75aa41b314e","resolution":{"observed_at":"2026-08-04T16:34:04.212824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.374735Z","title":"Knowledge amalgamation from hetero- geneous networks by common feature learning.International Joint Conference on Artificial Intelligence (IJCAI), 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.374735Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:f17a51c510a8e6bc160395666f85f1de3d86d92f26445af5ab7c2c967f4589f5","observation_id":"6b1c6a10-49c7-4117-a46f-9acdf7c45d7c","resolution":{"observed_at":"2026-08-04T16:34:04.374735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.431456Z","title":"Rtdetrv2: All-in-one detection transformer beats yolo and dino, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.431456Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:03444e6c6621a94ae918c3e2fb77dc1f0dab60d13fa91d3fbd26f08509608ed0","observation_id":"998ee18a-13b8-4de0-8f64-9b2c567612b1","resolution":{"observed_at":"2026-08-04T16:34:04.431456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.563554Z","title":"Toward founda- tion models for inclusive object detection: Geometry- and category-aware feature extraction across road user categories","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.563554Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:89f2836028049a75a66cf1c764fc3ee92e72deb6bc2370dce5108eb9ca6e4a70","observation_id":"11a49e2d-f4da-444c-8b3b-8e0e553f1239","resolution":{"observed_at":"2026-08-04T16:34:04.563554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.714746Z","title":"Object-conditioned bag of instances for few-shot personalized instance recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.714746Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:a81fbd7126df479a4488de1124de095cffc1aee7fdec992cb2ed17e12782b532","observation_id":"5058fa67-be35-4a6b-819c-939982e4129e","resolution":{"observed_at":"2026-08-04T16:34:04.714746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T16:34:04.811305Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.811305Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:931a3c223c96af3a705fef3c91af0ef9e7e42e4ddc1f48ad0ee29391ab833214","observation_id":"1c4af3f5-2b80-4cf7-a8b8-12ee650d49fe","resolution":{"observed_at":"2026-08-04T16:34:04.811305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:04.916226Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:04.916226Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:cc1d57b55fe9018dd67026466024e34f210bbc5f05b9918b090d0e246868717b","observation_id":"eeea43bc-8f27-47f8-8570-abbaaa11eb2d","resolution":{"observed_at":"2026-08-04T16:34:04.916226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:05.079614Z","title":"Swiss dino: Efficient and versatile vision framework for on-device personal object search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:05.079614Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:94fe6c1490c55442b3d65b5daba74ae9c2a5be421fa9d63a60972a5d66a5f6eb","observation_id":"692cdf27-0d00-4ea0-ba14-d879896c7835","resolution":{"observed_at":"2026-08-04T16:34:05.079614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:05.190941Z","title":"Het- erogeneous knowledge distillation using information flow modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:05.190941Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:cd625110f2faafd611ba01247ba8c42550bbf58fa2b4f979327cb47a8bb745fa","observation_id":"f469eda4-3e79-40b3-af24-3ae0dbd92deb","resolution":{"observed_at":"2026-08-04T16:34:05.190941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:05.314658Z","title":"Learning transferable visual models from natural language supervision.Proceedings of Machine Learning Research (PMLR), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:05.314658Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:43b2d31d7cde68a9d34ee1b030c907219592b1a6a326cacb83cf256f0b2d26ad","observation_id":"8495e591-d87c-452f-bca1-f3ca0b29ee42","resolution":{"observed_at":"2026-08-04T16:34:05.314658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:05.501903Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:05.501903Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:9bfec904bfb10b704d9ed81c4731a2c3471f169cbaefe538d42cf7d368fbbe75","observation_id":"7101b296-882b-4cf2-a25b-ccb0bc821e6c","resolution":{"observed_at":"2026-08-04T16:34:05.501903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:05.610910Z","title":"Prototypi- cal networks for few-shot learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:05.610910Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:e78dce66bc5730d461f6b28ba1f4c7b3004cdd59477274aeff1b6ecfcf3a6a1f","observation_id":"0720e353-2c2d-4190-82ab-624f6e186e29","resolution":{"observed_at":"2026-08-04T16:34:05.610910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:05.744749Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:05.744749Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:75601873f61580337042e781d346153400f84e141fafd6db423cd940d9ecc35c","observation_id":"e9ccecff-3d87-456b-a928-809f8d189afc","resolution":{"observed_at":"2026-08-04T16:34:05.744749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:05.864746Z","title":"Hybrid knowledge distillation network for RGB-D co- salient object detection.IEEE Transactions on Systems, Man, and Cybernetics: Systems, pages 1–12, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:05.864746Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:b9ecd47029fc84a7c8c7e6e78957159da9d40a000daf5128d63cc7d6e113fb7a","observation_id":"055f7f82-6462-4224-a48e-9a708e4d56c8","resolution":{"observed_at":"2026-08-04T16:34:05.864746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:05.994819Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:05.994819Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:d856877c9c699bcbdecfdb5c838c0bf89a4d707ae086dd1176c9c24cf003bc5e","observation_id":"be4e1df7-c374-4c64-9d39-921f476e5a4d","resolution":{"observed_at":"2026-08-04T16:34:05.994819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:06.126465Z","title":"Seggpt: Segmenting everything in context.IEEE/CVF International Conference on Computer Vision (ICCV), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:06.126465Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:1212064f2f80d6cb5d0c118d7b05e740cf6d6b2deb4d8ec19042a0e840898b8b","observation_id":"317957d5-11b7-4294-adcb-e147358bb9e6","resolution":{"observed_at":"2026-08-04T16:34:06.126465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:06.368827Z","title":"Weinberger, and Laurens van der Maaten","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:06.368827Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:e86b4388d993cfacf746b4fd25e3f5a50b1aa256b8e465d271c631994fed9e83","observation_id":"e092db26-5c12-421a-bc42-5b003f3d0ab8","resolution":{"observed_at":"2026-08-04T16:34:06.368827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:06.564749Z","title":"Cmda: Cross-modality domain adap- tation for nighttime semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:06.564749Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:5e34944262eaf2e9fae4ab46aa12e7980278fdb95532f0730bc7d8f071651d48","observation_id":"0cde860c-4606-4528-8d96-a53bbf58d0e3","resolution":{"observed_at":"2026-08-04T16:34:06.564749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:06.789210Z","title":"Task-oriented feature distillation.Advances in Neural Information Processing Systems, 33:14759–14771,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:06.789210Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:163386321627e2a95ba7835c042220338edf6b835a7128efddd45e23705ba53f","observation_id":"10f46754-95ea-4ac6-b6fc-f8108e467c06","resolution":{"observed_at":"2026-08-04T16:34:06.789210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:06.910479Z","title":"Personalize segment anything model with one shot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:06.910479Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:e1c93ffb9df47f2371c893a53c2627e8b7475fcd630814e06730a74fa8333964","observation_id":"171ba98d-dfab-4f41-9c0d-38e90fafefa2","resolution":{"observed_at":"2026-08-04T16:34:06.910479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:34:07.063560Z","title":"Personalized image semantic segmen- tation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T16:34:07.063560Z"},"links":{"citing_paper":"/paper/2509.14001"},"observation_digest":"sha256:dbd99a68c766337d9ff61bebdbd98658d98ff1af060f075a0f978a1ba0546c4b","observation_id":"766c9e87-696f-43f0-9953-670ae984fb62","resolution":{"observed_at":"2026-08-04T16:34:07.063560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.14001","last_updated":"2026-06-22T21:21:01Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T16:33:59.614745Z","submitted_at":"2025-09-17T14:13:20Z","title":"MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2509.14001."}