Skill Mining: Daripada 3,500 Calon Kepada 466 Keupayaan
> Kami menyaring 3,500 calon skill dan mengadaptasi 466. Satu gelung mining dan ingestion yang sistematik untuk membina perpustakaan skill ejen AI yang koheren pada skala besar.
Angka dalam penulisan ini mencerminkan sistem pada masa penerbitan (Januari 2026). Lihat halaman pasukan kami untuk angka terkini.
Masalah 3,500 Skill
Apabila kami mula membina satu sistem orkestrasi ejen, kami berhadapan dengan satu cabaran yang menarik: terdapat beribu-ribu bakal skill yang bertaburan merentasi ekosistem AI. Repositori GitHub, dokumentasi vendor, projek komuniti, corak dalaman - skill wujud di mana-mana. Tetapi yang mana penting? Yang mana berfungsi? Dan bagaimana anda menyenggara satu perpustakaan skill yang koheren yang benar-benar boleh digunakan oleh ejen?
Jawapan kami: satu gelung mining dan ingestion yang sistematik.
Angka Hari Ini
Lebih tiga bulan sedikit selepas Anthropic melancarkan Agent Skills pada 16 Oktober 2025, berikut kedudukan kami apabila penulisan ini diterbitkan pada 27 Januari 2026:
| Metrik | Bilangan |
|---|---|
| Calon dikenal pasti | 3,500+ |
| Skill diadaptasi | 466 |
| Skill vendor | 373 |
| Skill dalaman | 93 |
| Vendor aktif | 25+ |
| Purata token setiap skill | 2,834 |
| Tool dirujuk | 89 |
| Tag unik | 635 |
Kami telah menyemak lebih 3,500 calon skill. Kami telah mengadaptasi 466. Itu adalah kadar adaptasi 13% - dan keselektifan itu adalah sengaja.
Sistem Tier Pengetahuan
Bukan semua skill dicipta setara. Kami menyusunnya ke dalam lima lapisan pengetahuan (K0-K4), setiap satu mewakili skop kebolehterapan yang berbeza:
K0: Foundations (Universal)
Skill yang sepatutnya dimiliki oleh setiap ejen. Ini mewakili keupayaan “pemikir yang baik” yang berfungsi di mana-mana.
foundations/
├── test-first-discipline # TDD: Red-Green-Refactor
├── evidence-based-completion # Verify before claiming done
├── systematic-debugging # Root cause methodology
├── structured-planning # Break work into tasks
└── context-budget-awareness # Manage token consumption
Skill K0 boleh dibawa ke mana-mana projek, mana-mana domain, mana-mana stack. Ia mengekod corak kognitif universal.
K1: Identities (Disiplin)
Skill “jurutera yang baik” atau “penyelidik yang baik” yang terpakai merentasi projek dalam sesuatu disiplin.
identities/
├── research-workflows # Multi-source research
├── web-extraction-playbook # Content extraction
├── code-review # PR review patterns
└── cli-interface-standards # CLI design patterns
K2: Domains (Kepakaran Subjek)
Skill “pakar pangkalan data yang baik” atau “jurutera keselamatan yang baik” yang boleh dibawa dalam sesuatu bidang.
domains/
├── schema-migration-workflow # Safe migration patterns
├── rpc-validation-checklist # RPC health checks
├── auth-validation-checklist # JWT/OAuth patterns
└── secrets-audit-checklist # Credential scanning
K3: Stacks (Teknologi)
Skill “pengguna Supabase yang baik” atau “developer Cloudflare yang baik” untuk stack teknologi tertentu.
stacks/
├── maguyva-quickstart # Our semantic search patterns
├── cloudflare-deployment # Workers/Pages deployment
└── mcp-tool-best-practices # MCP tool selection
K4: Project (Organisasi)
Skill khusus untuk organisasi dan aliran kerja kami.
project/
├── agent-creation-workflow # How we build agents
├── skill-authoring-workflow # How we write skills
├── mining-session-workflow # This very process
└── vendor-skill-evaluation # Evaluation rubrics
Gelung Mining
Fasa 1: Discovery
Skill datang dari mana-mana:
Repositori Vendor: AWS, Anthropic, Cloudflare, Supabase, dan penyumbang komuniti menerbitkan koleksi skill. Kami menjejaki 25+ root vendor.
Projek Komuniti: GitHub penuh dengan templat Claude Code, corak ejen, dan takrifan aliran kerja.
Corak Dalaman: Semasa pasukan kami menyelesaikan masalah, corak muncul. Ini diformalkan menjadi skill.
Perlombongan Dokumentasi: Dokumentasi teknikal selalunya mengandungi skill tersirat - prosedur, senarai semak, pokok keputusan.
Discovery adalah berterusan. Kami menggunakan backlog skill untuk menjejaki calon sebelum penilaian formal.
Fasa 2: Evaluation
Setiap calon melalui rubrik yang sama:
adoption_criteria:
- fills_real_gap: true # We lack this capability
- well_structured: true # Progressive disclosure
- actively_maintained: true # Commits in last 6 months
- portable: true # Not hyper-specific
- tested: true # Evidence of usage
Kesemua lima kriteria produk mesti lulus. Inilah sebabnya 87% calon ditolak.
Kemudian setiap calon melalui satu semakan kepercayaan yang berasingan. Kami tidak menganggap repositori vendor rasmi, penyenggara komuniti yang terkenal, dan repositori GitHub rawak sebagai sumber kebenaran yang setara.
trust_review:
vendor_credibility:
- ownership_verified # Official vendor, known maintainer, or internal source
- maintenance_signal # Recent commits, issue response, release history
- adoption_signal # Evidence of real use, stars alone are not enough
- provenance_clear # We can trace where the skill came from
prompt_injection_scan:
- hidden_instruction_check # Buried "ignore previous instructions" patterns
- exfiltration_check # Prompts that try to leak files, secrets, or context
- authority_check # Claims of priority over system or developer rules
script_audit:
- inspect_scripts # Read shell/python/js helpers before adoption
- network_and_exec_review # curl|bash, remote downloads, subprocess execution
- file_and_secret_review # Env vars, credential access, broad file writes
- destructive_action_check # rm, reset, overwrite, or unsafe automation
Vendor yang dipercayai mendapat semakan provenans yang lebih ringan, tetapi bukan laluan bebas. Sumber yang tidak dipercayai atau tidak diketahui mendapat audit manual yang lebih mendalam, dan kami tidak melaksanakan skrip yang dibundel sehingga ia telah dibaca, diskop, dan diklasifikasikan sebagai selamat.
Analisis Jurang: Sebelum mengadaptasi, kami mencari registri kami:
uv run orkestra skills search "<capability>"
Jika kami sudah mempunyainya, kami tidak memerlukannya. Jika kami mempunyai sesuatu yang hampir, kami mungkin merge dan bukan mengadaptasi.
Skor Kedalaman dan Piawaian: Kami juga memberi skor kepada sejauh mana sesuatu calon menggunakan model agent-skill sepenuhnya. Satu SKILL.md yang bersendirian masih boleh berguna, tetapi skill yang lebih mendalam lebih bernilai apabila ia memisahkan arahan daripada rujukan, skrip, dan aset dengan cara yang digalakkan oleh agentskills.io.
skill_depth:
- level_1: SKILL.md only # Single instruction file
- level_2: SKILL.md + strong description # Clear triggers and scope
- level_3: adds references/ # Load docs only when needed
- level_4: adds atomic scripts/ # Small, reviewable helpers
- level_5: adds assets/examples/templates # Full progressive disclosure
depth_signals:
- standards_adherence # Structure aligns with agentskills.io conventions
- reference_quality # Curated references, not giant context dumps
- script_atomicity # Focused helpers, not opaque monoliths
- tool_boundary_clarity # Clear limits on what the skill can execute
- community_signal # Stars/forks/users help, but only as a weak boost
Bintang GitHub boleh meningkatkan skor kredibiliti sedikit, tetapi ia tidak pernah menyelamatkan skill yang cetek atau tidak selamat. Satu repo berbintang tinggi dengan satu SKILL.md yang kabur dan skrip legap mendapat skor lebih rendah daripada satu repo yang lebih kecil dengan penerangan yang tepat, references/ yang dikurasi, dan helper atomik yang benar-benar memanfaatkan keupayaan skill sepenuhnya.
Analisis Struktur: Kami menyemak kualiti skill:
wc -l vendor/<repo>/<skill>/SKILL.md # Size check
ls vendor/<repo>/<skill>/scripts/ # Supporting files
ls vendor/<repo>/<skill>/references/ # Bundled docs
Jika sesuatu calon merangkumi skrip, semakan itu menjadi lebih ketat. Satu skill yang baik bukan sekadar berguna; ia mesti mudah difahami, bersempadan, dan selamat untuk diserahkan kepada seorang ejen. Penapis keselamatan itu sahaja mendiskualifikasikan sebahagian besar calon yang sebenarnya menarik.
Fasa 3: Ingestion
Apabila sesuatu skill lulus penilaian, ia memasuki registri. Tetapi skill tidak pernah diadaptasi tanpa perubahan. Ia diubah suai supaya sesuai dengan sistem kami.
Pengubahsuaian Semasa Adaptasi:
- Normalisasi Metadata: Setiap skill mendapat skema frontmatter kami
- Penetapan K-Tier: Skill diletakkan dalam lapisan pengetahuan yang sesuai
- Pengayaan Tag: Tag ditambah untuk discovery
- Pengisytiharan Tool: Tool yang dibenarkan diisytiharkan secara eksplisit
- Penjajaran Seksyen: Kandungan disusun semula untuk sepadan dengan templat kami
Satu YAML skill biasa selepas ingestion:
metadata:
identifier: vendor-skill-evaluation
name: vendor-skill-evaluation
description: Systematic evaluation of vendor skills for adoption.
type: workflow
layer: K4
semantic_folder: project
source: core
last_updated: '2026-01-17'
frontmatter:
tags:
- agents
- meta
- skill-adoption
- vendor
allowed_tools:
- Bash
- Read
- Write
- Edit
- Grep
- Glob
- Task
Fasa 4: Scope Assignment
Skill diberikan kepada scope - kategori yang menentukan ejen mana memuatkan skill mana:
scopes:
database:
primary_skills:
- domains/schema-migration-workflow
- domains/rpc-validation-checklist
- vendor/supabase/supabase-database
- vendor/supabase/supabase-auth
research:
primary_skills:
- identities/research-workflows
- identities/web-extraction-playbook
- identities/dataset-discovery-quickstart
Ejen mengisytiharkan scope mereka, dan skill diberikan secara automatik:
# Agent definition
scopes: [database, research]
# Gets: all database skills + all research skills + universal skills
Fasa 5: Materialization
Skill tidak hidup sebagai YAML dalam pengeluaran. Ia dirender menjadi fail SKILL.md yang boleh dimuatkan oleh Claude Code:
uv run orkestra sync
Arahan ini:
- Membaca semua takrifan YAML skill
- Merender ia menerusi templat Jinja
- Menulis fail SKILL.md ke
.claude/skills/ - Menyusun mengikut K-tier (foundations/, identities/, domains/, stacks/, project/)
Struktur output akhir:
.claude/skills/
├── foundations/ # K0: Universal
├── identities/ # K1: Discipline
├── domains/ # K2: Subject
├── stacks/ # K3: Technology
├── project/ # K4: Organization
└── vendor/ # External skills
Corak Scope Dorman
Salah satu corak kami yang paling berkuasa ialah skill “diadaptasi-tetapi-tidak-dimuatkan.” Kami memanggilnya dormant scope.
Pertimbangkan skill pengkomputeran saintifik daripada repositori k-dense-scientific. Kami telah mengadaptasi 120+ skill merangkumi bioinformatik, kimia, pengkomputeran kuantum, dan informatik klinikal. Tetapi kebanyakan ejen kami tidak memerlukan molecular docking atau analisis ekspresi gen.
Selain memuatkan kesemua 120 skill ke dalam setiap ejen (yang membazirkan tetingkap konteks), kami:
- Mengadaptasi skill itu dengan scope tertentu (contohnya,
bioinformatics) - Mengekalkannya dorman - didaftarkan tetapi tidak dimuatkan
- Mengaktifkan ia hanya apabila seorang ejen mengisytiharkan scope itu
# In scopes.yaml - dormant scope
bioinformatics:
description: "Bioinformatics and genomics"
primary_skills: [] # Empty - skills exist but aren't loaded
# When an agent needs bioinformatics:
# Agent YAML
scopes: [research, bioinformatics] # Now loads bioinformatics skills
Corak ini membolehkan kami mempunyai 466 skill dalam registri sementara ejen biasa hanya memuatkan 40-60 yang relevan.
Jenis Skill
Skill datang dalam tiga corak kognitif:
Workflow
Langkah prosedural tersusun: “1. Lakukan X, 2. Kemudian Y, 3. Akhirnya Z”
type: workflow
# Examples: schema-migration-workflow, mining-session-workflow
Discipline
Pagar gelagat: “Sentiasa X”, “Jangan sesekali Y”, “Utamakan Z”
type: discipline
# Examples: test-first-discipline, evidence-based-completion
Checklist
Kriteria pengesahan: “Sahkan X”, “Verifikasi Y”, “Semak Z”
type: checklist
# Examples: auth-validation-checklist, secrets-audit-checklist
Gate Kualiti
Setiap skill mesti lulus pengesahan sebelum ia dikeluarkan:
validation:
file_exists: true # Skill file at declared path
frontmatter_valid: true # Frontmatter parses correctly
sections_complete: true # Expected sections present
tools_registered: true # Declared tools exist in registry
Penerangan mesti 50-400 aksara dengan frasa pencetus (“Use when…”, “When you need…”) supaya Claude Code tahu bila hendak mencadangkannya.
Kami mengesahkan secara berterusan:
uv run orkestra validate --show-warnings
Ekosistem Vendor
373 skill vendor kami datang daripada:
| Penyedia | Skill | Domain |
|---|---|---|
| AWS Agent | 19 | Perkhidmatan cloud |
| Anthropic | 12 | Penjanaan dokumen |
| Cloudflare | 8 | Pengkomputeran edge |
| Supabase | 5 | Pangkalan data |
| k-dense | 100+ | Pengkomputeran saintifik |
| silvainfm | 4 | Data science |
| Java Developer Kit | 45+ | Spring/Java |
| Vercel | 1 | Automasi browser |
Setiap root vendor diisytiharkan dalam metadata.yaml:
vendor_roots:
- path: vendor/aws-agent-skills
provider: aws
- path: vendor/k-dense-scientific/scientific-skills
provider: k-dense
- path: vendor/supabase-skills
provider: supabase
Apabila orkestra sync berjalan, skill vendor disymlink ke dalam .claude/skills/vendor/ dengan namespace penyedianya.
Apa Yang Kami Pelajari
Keselektifan berbaloi. Amat menggoda untuk mengadaptasi segala-galanya yang kelihatan berguna. Tetapi setiap skill menelan kos token. Dengan purata 2,834 token setiap skill, kegembungan menyakitkan dengan cepat. Kadar adaptasi 13% kami mengekalkan ejen kekal ramping.
Struktur membolehkan discovery. Sistem K-tier bukan sekadar penyusunan - ia tentang portabiliti. Skill K0 boleh digunakan semula di mana-mana. Skill K4 sengaja khusus projek. Kejelasan ini membantu manusia dan ejen mencari apa yang mereka perlukan.
Dormant scope menskalakan. Anda boleh mengadaptasi beratus-ratus skill tanpa memuatkannya semua. Scope membolehkan anda membina satu registri komprehensif sambil mengekalkan tetingkap konteks ejen individu boleh diurus.
Pengubahsuaian semasa adaptasi adalah penting. Skill vendor mentah jarang sesuai dengan sistem anda. Proses ingestion - menambah metadata, memberikan tier, memperkaya tag - menjadikan skill luaran berfungsi secara dalaman.
Mining adalah berterusan. Angka 3,500 itu terus berkembang. Repo vendor baharu muncul. Corak komuniti terserlah. Aliran kerja dalaman menjadi mantap. Gelung ini tidak pernah berhenti.
Apa Seterusnya
Kami sedang mengusahakan beberapa penambahbaikan:
- Pengesanan gap automatik: Memberi amaran apabila kegagalan ejen yang biasa boleh ditangani oleh satu skill yang belum diadaptasi
- Aliran kerja deprecation skill: Proses formal untuk menyara skill yang telah digantikan atau tidak digunakan
- Kebergantungan silang-skill: Pengisytiharan eksplisit prasyarat skill
- Analitik penggunaan: Menjejaki skill mana yang benar-benar dipanggil oleh ejen berbanding sekadar dimuatkan
Gelung skill mining adalah infrastruktur. Ia tidak glamour. Tetapi itulah yang menjadikan 41 ejen berfungsi secara koheren dengan 466 keupayaan sambil kekal dalam had konteks.
Itulah kisah bagaimana 3,500 menjadi 466. Bukan dengan mengabaikan 3,000 - tetapi dengan menilainya secara sistematik dan mengadaptasi hanya apa yang berfungsi.
Mahu melihat sistem skill beraksi? Lihat uv run orkestra skills list untuk meneroka registri semasa kami.
Bacaan berkaitan
Lagi daripada log pembinaan Maguyva
Mengapa Kami Menaik Taraf Carian Kod kepada voyage-4-large_
Kami mengalihkan embeddings kod kami kepada voyage-4-large — kini berada di puncak leaderboard pengambilan kod RTEB awam. Versi jujurnya: trade yang kami buat, apa yang benar-benar kami indeks, dan mengapa kami membayar untuk embeddings premium.
Penambahbaikan Kendiri Rekursif Bahasa: Menggilap Code Intelligence Merentasi ~280 Bahasa_
Kami menyokong code intelligence untuk ~280 bahasa. Tiada manusia yang mampu mengaudit itu secara manual. Jadi kami membina gelung penambahbaikan kendiri rekursif bahasa — semak rawak, LLM-sebagai-hakim, baiki satu perkara, sahkan semula — dan menjalankannya dengan sepasukan ejen terasing sehingga pengekstrakan benar-benar betul, bukan sekadar hijau.
Carian Fusion Pelbagai-Modal: Memilih Retriever Yang Tepat Untuk Setiap Pertanyaan_
Pertanyaan seperti 'di mana parseConfig ditakrifkan' mahukan carian yang berbeza daripada 'bagaimana auth berfungsi'. Maguyva mengklasifikasikan niat, memberi pemberat kepada empat modaliti pengambilan mengikutnya, dan menggabungkan hasil dengan Reciprocal Rank Fusion berpemberat.