{"as_of":"2026-08-23T07:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa9591e9f0e620f038489eee2d1077cf7ada48e9e8e84eaa0d34eb47df46ec78","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:58:37.902563Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10569/citation-record","integrity":"/paper/2412.10569/integrity","json":"/paper/2412.10569/citation-record.json","paper":"/paper/2412.10569"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:39.241667Z","title":"Anderson, B","venue":null,"work_id":"fd59c881-3abf-4798-acbc-163e8cec5d11","year":2016},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.401510Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:ad4f4adf1dc784aa93bc403015b9a2c1349a702ff35dc3ce8b01893d95d85310","observation_id":"7dfcc975-be77-4f2e-a0fa-4782bde0f3f3","resolution":{"observed_at":"2026-08-11T15:58:39.294676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:39.188294Z","title":"Bolya, C.-Y","venue":null,"work_id":"31db500b-25dc-4ab1-9df2-e911baaa3279","year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.406466Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:871637fd69e3ebfbd9fc2c114d42545c0f0fb09d21b80f34bd556e49d229e345","observation_id":"4dd1f137-0085-4780-8ded-cb4826eb0f9d","resolution":{"observed_at":"2026-08-11T15:58:39.192248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:39.176562Z","title":"Bolya and J","venue":null,"work_id":"0ae5c0cf-c2f6-4fab-bada-d2bca2ccb3b0","year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.410907Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:41327886ddf4878eb84d08850d988cb4df1c1f23a277b1cb9de1cf32510679e8","observation_id":"7aba9905-795f-45f0-a771-d46aca952867","resolution":{"observed_at":"2026-08-11T15:58:39.180281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:39.164381Z","title":"Carion, F","venue":null,"work_id":"bc97690a-4aac-474a-acc3-4184bcf2b314","year":2020},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.415246Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:e8e5df28e1cb64a9838f4471c0029fff0d3d86cb83cdfda991b3f88e49ad7741","observation_id":"185f7ca0-7958-45dd-8137-dbe78f817dc8","resolution":{"observed_at":"2026-08-11T15:58:39.169263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:39.153227Z","title":null,"venue":null,"work_id":"46490f56-ab9a-4c8f-b944-be4c201f917e","year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.419185Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:bbf4f235f4d4ed7b39cc328080538f3f90a89cb1e6498d16b82b12a6aa2ca4f5","observation_id":"35801fde-6481-4708-87d4-53dd95d6e68c","resolution":{"observed_at":"2026-08-11T15:58:39.157204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T15:58:37.424538Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.424538Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:40a0b9e4c6b6c9967f40860fae2ece040be36adae2f842d879bb67a9efcaa39e","observation_id":"cc9cab0f-3710-4ce6-8635-62338ba60e0a","resolution":{"observed_at":"2026-08-11T15:58:37.424538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:39.141621Z","title":"Contributors","venue":null,"work_id":"abafc483-3a00-4791-aee0-272d786a3c20","year":2020},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.430637Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:e10287709a620bdaf7809b10eff96f3e4ccad3d3d194039ff9f1960ff3df8bb1","observation_id":"a5087f13-ff6d-439e-9ffe-51927f3f4b50","resolution":{"observed_at":"2026-08-11T15:58:39.144973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:39.128816Z","title":null,"venue":null,"work_id":"3b9e7de9-a8d0-46ed-9765-119cbf448064","year":2009},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.434980Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:12def53447827f6745c84af8796e77dd34f42326e1525e06d93b27902bd268de","observation_id":"64d10de1-1549-4a0b-a1ec-dc5e2eb9f001","resolution":{"observed_at":"2026-08-11T15:58:39.133753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.993934Z","title":"Dosovitskiy, L","venue":null,"work_id":"dbd6b575-27e5-491f-ae17-05f7bddfcb0f","year":2021},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.439450Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:d3e8a3efa392975776f3b689a5f85b574bec3c0062b1c7aa7a9082cc7ad49cc2","observation_id":"5d543d9f-4c83-4d2e-bbfc-e7d8ac0808c6","resolution":{"observed_at":"2026-08-11T15:58:39.046717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.982733Z","title":"Fayyaz, S","venue":null,"work_id":"a60f54a1-6b55-4734-9a0c-ead47b323c98","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.442850Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:bcfcbf66ca1bd762503c97d045e05748bc4da079c4664732cd0593fb07c96427","observation_id":"9574418d-1ff3-4106-a933-1ac30ea24c7e","resolution":{"observed_at":"2026-08-11T15:58:38.986730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.971222Z","title":null,"venue":null,"work_id":"93bbe5f3-15f2-4c15-86d3-8392322cc2c8","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.458868Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:29fe79f14d4ecdf03f127a8f77cdf31b2369d16c468f499f883eea0a63f0a40a","observation_id":"236cadc0-17c4-4eb9-ab77-a8e1dda17767","resolution":{"observed_at":"2026-08-11T15:58:38.974810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02331","last_updated":"2024-07-01T10:16:38Z","snapshot_observed_at":"2026-08-16T15:50:51.750640Z","submitted_at":"2023-03-04T05:34:25Z","title":"Training-Free Acceleration of ViTs with Delayed Spatial Merging","version":2},"cited_work":{"arxiv_id":"2303.02331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.02331","snapshot_observed_at":"2026-08-11T15:58:38.000785Z","title":"Training-Free Acceleration of ViTs with Delayed Spatial Merging","venue":"cs.CV","work_id":"d8ae877f-b674-4447-b41f-b6f9dfc1b6fa","year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.509275Z"},"links":{"cited_paper":"/paper/2303.02331","citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:dbf2cb0130aa8a7a0c41e2a012884366e5db45a87cd5d49592f2d505f4c10b5f","observation_id":"4f49d1cb-235f-4b33-b15b-6553973afcbe","resolution":{"observed_at":"2026-08-11T15:58:38.006936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.960496Z","title":"Jiang, Q","venue":null,"work_id":"42e06312-1b45-4dd1-bb29-31aff2950eb2","year":2021},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.585010Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:534facea675e86b068c7e3c4e58d6342f51a228d5aeb8af5dc76bd66d2571e73","observation_id":"c8889ac1-109c-42e7-82e6-dc564862cc14","resolution":{"observed_at":"2026-08-11T15:58:38.963863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.949576Z","title":"Karpathy and L","venue":null,"work_id":"5c8c805b-6533-472d-9ca4-b54826c55ebd","year":2015},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.588748Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:8f228cd57d1933a8d4c20c57b15e2f9fffd3a952e5859bf4aa0300e173114d46","observation_id":"812fd9cc-519c-4c31-87d4-3817b5498bf1","resolution":{"observed_at":"2026-08-11T15:58:38.953447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-11T15:58:37.591683Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.591683Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:6f21d82b6728606ba79f87063a42dcf1da62340c14bf879de7496f3233d165e8","observation_id":"181d3dcb-5191-4274-9bd7-393078760436","resolution":{"observed_at":"2026-08-11T15:58:37.591683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09019","last_updated":"2022-09-15T18:04:10Z","snapshot_observed_at":"2026-08-16T16:32:11.617696Z","submitted_at":"2022-09-15T18:04:10Z","title":"LAVIS: A Library for Language-Vision Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.09019","snapshot_observed_at":"2026-08-11T15:58:37.595470Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.595470Z"},"links":{"cited_paper":"/paper/2209.09019","citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:f1c8039710a6515593e7cf18f27df4806cbc3ac5794a9cc7e818244d1c1c5d5f","observation_id":"8e62ca3c-c06b-49cf-8f14-bfb4493e15e4","resolution":{"observed_at":"2026-08-11T15:58:37.595470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T15:58:37.598567Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.598567Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:33b2234b295369e50fda5f5f7b27db4565317a04858a380d0fb86c2220974bdc","observation_id":"99fb9f39-68ef-42db-86fe-2ec3308e7e98","resolution":{"observed_at":"2026-08-11T15:58:37.598567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.835174Z","title":"Liang, C","venue":null,"work_id":"3adeb40a-10ef-471c-b726-882799942e16","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.602566Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:8ef13b3c9f650ffa9ca826e2c85e4dc45d589b9aae30c683cd28ff6b3d9b24ef","observation_id":"32a5bf89-fa2e-48c7-a2c1-6818086cc907","resolution":{"observed_at":"2026-08-11T15:58:38.887394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.744046Z","title":null,"venue":null,"work_id":"219b5ed0-82cc-4184-8690-2f4c2a9bd284","year":2024},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.605517Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:4348ceb49ea7763ef9075e6491678b26f7f0b6cda216f692593f435be8377c9f","observation_id":"6e938613-de9a-49b3-a5ee-6db111fb0e7e","resolution":{"observed_at":"2026-08-11T15:58:38.747125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.733357Z","title":null,"venue":null,"work_id":"1ca5eaee-25ab-493a-a5c1-ef70f5e84b5b","year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.609587Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:72a767048774e157c1607847a3a731f4804b28e46dca3879034bb48bce35c50d","observation_id":"bbb270ac-bb8f-47b4-886a-c7fac92c2df0","resolution":{"observed_at":"2026-08-11T15:58:38.736748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.721751Z","title":"Marin, J.-H","venue":null,"work_id":"3d05bf8f-2163-4288-9db0-480ef10c1820","year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.613294Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:176c84612caea86fcfe76b61a48c8aec80f53123d2f184a3a03033905c31aec5","observation_id":"2e9d12f4-6886-48ef-8821-68b06fc2c033","resolution":{"observed_at":"2026-08-11T15:58:38.725617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.708193Z","title":null,"venue":null,"work_id":"fbf59ff9-22e4-4f42-9398-55490b022b78","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.617227Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:7ee593f272c7c5184ada3763d56ae287c85db0025d452183479a9ee45820ee9d","observation_id":"e37a286d-e499-4e9e-872b-7e373012d298","resolution":{"observed_at":"2026-08-11T15:58:38.713600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.695993Z","title":null,"venue":null,"work_id":"76f82bcf-8688-4464-9ade-b97082dedb25","year":2021},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.621082Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:d0a4d290ae9ea6dbb16f510a3f686b95911ec626d38f6ef5f394bea21f88603e","observation_id":"4bf01946-5dbf-44de-92ba-5147ea4a5a72","resolution":{"observed_at":"2026-08-11T15:58:38.699713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.515098Z","title":"Papineni, S","venue":null,"work_id":"e2f61d7a-ed4a-489b-916a-86615faec213","year":2002},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.624318Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:b1b87da759dfdd79f51afc005d6cac91c2d93d5f6b967a418bf9fdedf4c5b15b","observation_id":"647c4e32-e1f7-455c-9eed-c0d0d6c609db","resolution":{"observed_at":"2026-08-11T15:58:38.589361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.481407Z","title":null,"venue":null,"work_id":"59b8830d-ae57-4196-b5c5-7aed4e5bf9bf","year":2021},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.628111Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:507dae99b67f8046c1d365aa8932f296017ea23e716a329393616bddda8a4e4d","observation_id":"2bc3ea93-4ad6-48fe-9035-c46c4fab2ede","resolution":{"observed_at":"2026-08-11T15:58:38.485067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12015","last_updated":"2022-02-24T10:56:17Z","snapshot_observed_at":"2026-08-16T17:18:58.644497Z","submitted_at":"2022-02-24T10:56:17Z","title":"Learning to Merge Tokens in Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12015","snapshot_observed_at":"2026-08-11T15:58:37.631716Z","title":"Renggli, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.631716Z"},"links":{"cited_paper":"/paper/2202.12015","citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:925d3a1cc49a132cfb5266db4ed345f9333d0b0c98b38ffff7b14eff04ea0bfb","observation_id":"fda73753-8bfc-40a1-aa23-7a488dad0657","resolution":{"observed_at":"2026-08-11T15:58:37.631716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.468610Z","title":null,"venue":null,"work_id":"97ea5682-9efc-4d9e-a842-f054dd71371f","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.635308Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:3a8d011235607ccd26419145c7b2aee0fbf15611e7fd4acf0b2379c31768d263","observation_id":"419f2ae6-bf64-48c9-934b-7531f464a15a","resolution":{"observed_at":"2026-08-11T15:58:38.473632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.456522Z","title":"Strudel, R","venue":null,"work_id":"f7377d0f-66dd-44ee-b26c-da99e5a01a7d","year":2021},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.639098Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:e8563db69d7c1501c5ee8483c7e560827c227064191db2d52538e6bcc5812723","observation_id":"f5daecd9-db37-4627-8b2d-c04f1d5ce606","resolution":{"observed_at":"2026-08-11T15:58:38.460311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.445206Z","title":"Touvron, M","venue":null,"work_id":"8e38e1ce-e143-46af-830b-87c257e9074d","year":2021},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.643294Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:ddeddb03e5355c4ee0edebb583c90977e5311279bd58c744a516cd83db9fd41b","observation_id":"8f243820-5729-48cf-8166-32e5e5cc1073","resolution":{"observed_at":"2026-08-11T15:58:38.449340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.432232Z","title":"Vaswani, N","venue":null,"work_id":"a0c221de-949f-424c-80ba-f5f4deb32092","year":2017},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.646442Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:d1a192e8bf8a434b24a14d325f079851f33dbf35a1bd8e5c2745aa638d396bb5","observation_id":"31a77ff1-8902-4b9b-9a0d-3b79d6bfad42","resolution":{"observed_at":"2026-08-11T15:58:38.437139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.413570Z","title":"Vedantam, C","venue":null,"work_id":"3b9454dc-610e-4a8f-ba30-4c22dd5cd0ac","year":2015},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.650188Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:4e5004fc5edb4d54f316be04d83a25b7fa3a1e6df7fde491e2e8ba481a859a06","observation_id":"9717fe62-3b18-4263-a076-2f43b78636e6","resolution":{"observed_at":"2026-08-11T15:58:38.418062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-20T03:47:10.217701Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-11T15:58:37.653643Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.653643Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:d6c3f8796d91611d468c49a0697be8ac8fb4e60a4420cb62ed8509f5e1292029","observation_id":"2468c635-83dc-44a2-a02a-7616c55f5649","resolution":{"observed_at":"2026-08-11T15:58:37.653643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.314624Z","title":null,"venue":null,"work_id":"88d543fe-5661-44fe-a2f0-dec23b6701de","year":2023},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.687903Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:2fa25b9dcb3cb69d8cfb95847af0271bbfbc5d0b26cff94474e4d3ebc2b1fd70","observation_id":"9bea4372-95e6-4e1e-b4e0-7a32f36cbe5d","resolution":{"observed_at":"2026-08-11T15:58:38.376915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.255249Z","title":"Wightman","venue":null,"work_id":"38461e00-8b59-4d2c-aad6-73d773b33545","year":2019},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.737139Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:8fdf8392dedf4faabb55dc910b57733d9ad8375464bfbbba2e39b6160c81a069","observation_id":"7955d2df-926e-44d5-98d4-e95c8f40c17e","resolution":{"observed_at":"2026-08-11T15:58:38.259764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.244446Z","title":null,"venue":null,"work_id":"92f3f2dd-2919-4c6c-a81f-afad9238ac32","year":2020},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.765247Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:b955048cc58639da3546c4b2149b3d4d8f50757fa60bdcc88f7b2c57dd387c26","observation_id":"842f8ebe-b4ef-4a05-bcba-8c690fd080a3","resolution":{"observed_at":"2026-08-11T15:58:38.248206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.232165Z","title":null,"venue":null,"work_id":"197fa77b-80b8-4a1c-94c1-ee37f8871cd8","year":2019},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.808104Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:f86c6e0eb31b2efb30248e2ff6b9c5f0c0a8df5873b36683adec30f861a2776a","observation_id":"2664c9b2-f48c-463b-88f1-c07de63a1d0e","resolution":{"observed_at":"2026-08-11T15:58:38.236396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.219961Z","title":null,"venue":null,"work_id":"84f40da9-0bb3-4fe0-9989-29f6b310dedf","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.841553Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:2ce4076e6f95ccc1f308a229918aab1c19be80e12269c728a15e402e132a3bb3","observation_id":"63bbf535-1b42-4b16-8a23-b98b77fbdb8a","resolution":{"observed_at":"2026-08-11T15:58:38.223623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.207023Z","title":null,"venue":null,"work_id":"9e8a70fc-3bca-424b-8741-e47b299d5ea0","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.889765Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:b32238e5eb9b89ec477e7c5c7cf8730e397e52f680710bd99b3fc6097b97a8e3","observation_id":"bbe34a00-f0b9-47a3-9186-533380811c9d","resolution":{"observed_at":"2026-08-11T15:58:38.211772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.144411Z","title":null,"venue":null,"work_id":"a74d33cc-8550-4d47-ade8-44157d0ed0bd","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.893681Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:a9ffc68aa2ae1bf06b3f7f7aaf06680275023d72060abd475703eb9a06ce4d3d","observation_id":"502ed587-b109-4454-a3dd-945877d9856b","resolution":{"observed_at":"2026-08-11T15:58:38.197934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.042399Z","title":null,"venue":null,"work_id":"fad2151a-e50d-4b6c-8e3a-2561064f3e75","year":2022},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.897942Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:8084fe8289745e3fee8a6b2f47531ed45e36e4aa4f4c917877f371f05568e004","observation_id":"0664fc7c-6ebd-47ba-9db0-095bcd755d20","resolution":{"observed_at":"2026-08-11T15:58:38.063922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:58:38.029550Z","title":null,"venue":null,"work_id":"bf7b11dd-8efc-4f52-af20-0ae394d81d40","year":2017},"citing_paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:58:37.902563Z"},"links":{"citing_paper":"/paper/2412.10569"},"observation_digest":"sha256:2399307f2626c0f3f0ce98875542ae1c6f88842f2f822b4be327fe5638875f6b","observation_id":"465e8fc5-06db-4fa9-ba00-f90b5b2fdc4a","resolution":{"observed_at":"2026-08-11T15:58:38.034613Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10569","last_updated":"2024-12-13T21:17:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:48:22.668996Z","submitted_at":"2024-12-13T21:17:11Z","title":"Learning to Merge Tokens via Decoupled Embedding for Efficient Vision Transformers"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2412.10569."}