Langkau ke kandungan
cd /blog

Skill Mining: Daripada 3,500 Calon Kepada 466 Keupayaan

[Seni Bina][Kemahiran]

> Kami menyaring 3,500 calon skill dan mengadaptasi 466. Satu gelung mining dan ingestion yang sistematik untuk membina perpustakaan skill ejen AI yang koheren pada skala besar.

Angka dalam penulisan ini mencerminkan sistem pada masa penerbitan (Januari 2026). Lihat halaman pasukan kami untuk angka terkini.

Masalah 3,500 Skill

Apabila kami mula membina satu sistem orkestrasi ejen, kami berhadapan dengan satu cabaran yang menarik: terdapat beribu-ribu bakal skill yang bertaburan merentasi ekosistem AI. Repositori GitHub, dokumentasi vendor, projek komuniti, corak dalaman - skill wujud di mana-mana. Tetapi yang mana penting? Yang mana berfungsi? Dan bagaimana anda menyenggara satu perpustakaan skill yang koheren yang benar-benar boleh digunakan oleh ejen?

Jawapan kami: satu gelung mining dan ingestion yang sistematik.

Angka Hari Ini

Lebih tiga bulan sedikit selepas Anthropic melancarkan Agent Skills pada 16 Oktober 2025, berikut kedudukan kami apabila penulisan ini diterbitkan pada 27 Januari 2026:

Metrik Bilangan
Calon dikenal pasti 3,500+
Skill diadaptasi 466
Skill vendor 373
Skill dalaman 93
Vendor aktif 25+
Purata token setiap skill 2,834
Tool dirujuk 89
Tag unik 635

Kami telah menyemak lebih 3,500 calon skill. Kami telah mengadaptasi 466. Itu adalah kadar adaptasi 13% - dan keselektifan itu adalah sengaja.

Sistem Tier Pengetahuan

Bukan semua skill dicipta setara. Kami menyusunnya ke dalam lima lapisan pengetahuan (K0-K4), setiap satu mewakili skop kebolehterapan yang berbeza:

K0: Foundations (Universal)

Skill yang sepatutnya dimiliki oleh setiap ejen. Ini mewakili keupayaan “pemikir yang baik” yang berfungsi di mana-mana.

foundations/
├── test-first-discipline       # TDD: Red-Green-Refactor
├── evidence-based-completion   # Verify before claiming done
├── systematic-debugging        # Root cause methodology
├── structured-planning         # Break work into tasks
└── context-budget-awareness    # Manage token consumption

Skill K0 boleh dibawa ke mana-mana projek, mana-mana domain, mana-mana stack. Ia mengekod corak kognitif universal.

K1: Identities (Disiplin)

Skill “jurutera yang baik” atau “penyelidik yang baik” yang terpakai merentasi projek dalam sesuatu disiplin.

identities/
├── research-workflows          # Multi-source research
├── web-extraction-playbook     # Content extraction
├── code-review                 # PR review patterns
└── cli-interface-standards     # CLI design patterns

K2: Domains (Kepakaran Subjek)

Skill “pakar pangkalan data yang baik” atau “jurutera keselamatan yang baik” yang boleh dibawa dalam sesuatu bidang.

domains/
├── schema-migration-workflow   # Safe migration patterns
├── rpc-validation-checklist    # RPC health checks
├── auth-validation-checklist   # JWT/OAuth patterns
└── secrets-audit-checklist     # Credential scanning

K3: Stacks (Teknologi)

Skill “pengguna Supabase yang baik” atau “developer Cloudflare yang baik” untuk stack teknologi tertentu.

stacks/
├── maguyva-quickstart          # Our semantic search patterns
├── cloudflare-deployment       # Workers/Pages deployment
└── mcp-tool-best-practices     # MCP tool selection

K4: Project (Organisasi)

Skill khusus untuk organisasi dan aliran kerja kami.

project/
├── agent-creation-workflow     # How we build agents
├── skill-authoring-workflow    # How we write skills
├── mining-session-workflow     # This very process
└── vendor-skill-evaluation     # Evaluation rubrics

Gelung Mining

Fasa 1: Discovery

Skill datang dari mana-mana:

Repositori Vendor: AWS, Anthropic, Cloudflare, Supabase, dan penyumbang komuniti menerbitkan koleksi skill. Kami menjejaki 25+ root vendor.

Projek Komuniti: GitHub penuh dengan templat Claude Code, corak ejen, dan takrifan aliran kerja.

Corak Dalaman: Semasa pasukan kami menyelesaikan masalah, corak muncul. Ini diformalkan menjadi skill.

Perlombongan Dokumentasi: Dokumentasi teknikal selalunya mengandungi skill tersirat - prosedur, senarai semak, pokok keputusan.

Discovery adalah berterusan. Kami menggunakan backlog skill untuk menjejaki calon sebelum penilaian formal.

Fasa 2: Evaluation

Setiap calon melalui rubrik yang sama:

adoption_criteria:
  - fills_real_gap: true      # We lack this capability
  - well_structured: true     # Progressive disclosure
  - actively_maintained: true # Commits in last 6 months
  - portable: true            # Not hyper-specific
  - tested: true              # Evidence of usage

Kesemua lima kriteria produk mesti lulus. Inilah sebabnya 87% calon ditolak.

Kemudian setiap calon melalui satu semakan kepercayaan yang berasingan. Kami tidak menganggap repositori vendor rasmi, penyenggara komuniti yang terkenal, dan repositori GitHub rawak sebagai sumber kebenaran yang setara.

trust_review:
  vendor_credibility:
    - ownership_verified       # Official vendor, known maintainer, or internal source
    - maintenance_signal       # Recent commits, issue response, release history
    - adoption_signal          # Evidence of real use, stars alone are not enough
    - provenance_clear         # We can trace where the skill came from
  prompt_injection_scan:
    - hidden_instruction_check # Buried "ignore previous instructions" patterns
    - exfiltration_check       # Prompts that try to leak files, secrets, or context
    - authority_check          # Claims of priority over system or developer rules
  script_audit:
    - inspect_scripts          # Read shell/python/js helpers before adoption
    - network_and_exec_review  # curl|bash, remote downloads, subprocess execution
    - file_and_secret_review   # Env vars, credential access, broad file writes
    - destructive_action_check # rm, reset, overwrite, or unsafe automation

Vendor yang dipercayai mendapat semakan provenans yang lebih ringan, tetapi bukan laluan bebas. Sumber yang tidak dipercayai atau tidak diketahui mendapat audit manual yang lebih mendalam, dan kami tidak melaksanakan skrip yang dibundel sehingga ia telah dibaca, diskop, dan diklasifikasikan sebagai selamat.

Analisis Jurang: Sebelum mengadaptasi, kami mencari registri kami:

uv run orkestra skills search "<capability>"

Jika kami sudah mempunyainya, kami tidak memerlukannya. Jika kami mempunyai sesuatu yang hampir, kami mungkin merge dan bukan mengadaptasi.

Skor Kedalaman dan Piawaian: Kami juga memberi skor kepada sejauh mana sesuatu calon menggunakan model agent-skill sepenuhnya. Satu SKILL.md yang bersendirian masih boleh berguna, tetapi skill yang lebih mendalam lebih bernilai apabila ia memisahkan arahan daripada rujukan, skrip, dan aset dengan cara yang digalakkan oleh agentskills.io.

skill_depth:
  - level_1: SKILL.md only                     # Single instruction file
  - level_2: SKILL.md + strong description     # Clear triggers and scope
  - level_3: adds references/                  # Load docs only when needed
  - level_4: adds atomic scripts/              # Small, reviewable helpers
  - level_5: adds assets/examples/templates    # Full progressive disclosure
depth_signals:
  - standards_adherence        # Structure aligns with agentskills.io conventions
  - reference_quality          # Curated references, not giant context dumps
  - script_atomicity           # Focused helpers, not opaque monoliths
  - tool_boundary_clarity      # Clear limits on what the skill can execute
  - community_signal           # Stars/forks/users help, but only as a weak boost

Bintang GitHub boleh meningkatkan skor kredibiliti sedikit, tetapi ia tidak pernah menyelamatkan skill yang cetek atau tidak selamat. Satu repo berbintang tinggi dengan satu SKILL.md yang kabur dan skrip legap mendapat skor lebih rendah daripada satu repo yang lebih kecil dengan penerangan yang tepat, references/ yang dikurasi, dan helper atomik yang benar-benar memanfaatkan keupayaan skill sepenuhnya.

Analisis Struktur: Kami menyemak kualiti skill:

wc -l vendor/<repo>/<skill>/SKILL.md  # Size check
ls vendor/<repo>/<skill>/scripts/     # Supporting files
ls vendor/<repo>/<skill>/references/  # Bundled docs

Jika sesuatu calon merangkumi skrip, semakan itu menjadi lebih ketat. Satu skill yang baik bukan sekadar berguna; ia mesti mudah difahami, bersempadan, dan selamat untuk diserahkan kepada seorang ejen. Penapis keselamatan itu sahaja mendiskualifikasikan sebahagian besar calon yang sebenarnya menarik.

Fasa 3: Ingestion

Apabila sesuatu skill lulus penilaian, ia memasuki registri. Tetapi skill tidak pernah diadaptasi tanpa perubahan. Ia diubah suai supaya sesuai dengan sistem kami.

Pengubahsuaian Semasa Adaptasi:

  1. Normalisasi Metadata: Setiap skill mendapat skema frontmatter kami
  2. Penetapan K-Tier: Skill diletakkan dalam lapisan pengetahuan yang sesuai
  3. Pengayaan Tag: Tag ditambah untuk discovery
  4. Pengisytiharan Tool: Tool yang dibenarkan diisytiharkan secara eksplisit
  5. Penjajaran Seksyen: Kandungan disusun semula untuk sepadan dengan templat kami

Satu YAML skill biasa selepas ingestion:

metadata:
  identifier: vendor-skill-evaluation
  name: vendor-skill-evaluation
  description: Systematic evaluation of vendor skills for adoption.
  type: workflow
  layer: K4
  semantic_folder: project
  source: core
  last_updated: '2026-01-17'

frontmatter:
  tags:
    - agents
    - meta
    - skill-adoption
    - vendor
  allowed_tools:
    - Bash
    - Read
    - Write
    - Edit
    - Grep
    - Glob
    - Task

Fasa 4: Scope Assignment

Skill diberikan kepada scope - kategori yang menentukan ejen mana memuatkan skill mana:

scopes:
  database:
    primary_skills:
      - domains/schema-migration-workflow
      - domains/rpc-validation-checklist
      - vendor/supabase/supabase-database
      - vendor/supabase/supabase-auth

  research:
    primary_skills:
      - identities/research-workflows
      - identities/web-extraction-playbook
      - identities/dataset-discovery-quickstart

Ejen mengisytiharkan scope mereka, dan skill diberikan secara automatik:

# Agent definition
scopes: [database, research]
# Gets: all database skills + all research skills + universal skills

Fasa 5: Materialization

Skill tidak hidup sebagai YAML dalam pengeluaran. Ia dirender menjadi fail SKILL.md yang boleh dimuatkan oleh Claude Code:

uv run orkestra sync

Arahan ini:

  1. Membaca semua takrifan YAML skill
  2. Merender ia menerusi templat Jinja
  3. Menulis fail SKILL.md ke .claude/skills/
  4. Menyusun mengikut K-tier (foundations/, identities/, domains/, stacks/, project/)

Struktur output akhir:

.claude/skills/
├── foundations/     # K0: Universal
├── identities/      # K1: Discipline
├── domains/         # K2: Subject
├── stacks/          # K3: Technology
├── project/         # K4: Organization
└── vendor/          # External skills

Corak Scope Dorman

Salah satu corak kami yang paling berkuasa ialah skill “diadaptasi-tetapi-tidak-dimuatkan.” Kami memanggilnya dormant scope.

Pertimbangkan skill pengkomputeran saintifik daripada repositori k-dense-scientific. Kami telah mengadaptasi 120+ skill merangkumi bioinformatik, kimia, pengkomputeran kuantum, dan informatik klinikal. Tetapi kebanyakan ejen kami tidak memerlukan molecular docking atau analisis ekspresi gen.

Selain memuatkan kesemua 120 skill ke dalam setiap ejen (yang membazirkan tetingkap konteks), kami:

  1. Mengadaptasi skill itu dengan scope tertentu (contohnya, bioinformatics)
  2. Mengekalkannya dorman - didaftarkan tetapi tidak dimuatkan
  3. Mengaktifkan ia hanya apabila seorang ejen mengisytiharkan scope itu
# In scopes.yaml - dormant scope
bioinformatics:
  description: "Bioinformatics and genomics"
  primary_skills: []  # Empty - skills exist but aren't loaded

# When an agent needs bioinformatics:
# Agent YAML
scopes: [research, bioinformatics]  # Now loads bioinformatics skills

Corak ini membolehkan kami mempunyai 466 skill dalam registri sementara ejen biasa hanya memuatkan 40-60 yang relevan.

Jenis Skill

Skill datang dalam tiga corak kognitif:

Workflow

Langkah prosedural tersusun: “1. Lakukan X, 2. Kemudian Y, 3. Akhirnya Z”

type: workflow
# Examples: schema-migration-workflow, mining-session-workflow

Discipline

Pagar gelagat: “Sentiasa X”, “Jangan sesekali Y”, “Utamakan Z”

type: discipline
# Examples: test-first-discipline, evidence-based-completion

Checklist

Kriteria pengesahan: “Sahkan X”, “Verifikasi Y”, “Semak Z”

type: checklist
# Examples: auth-validation-checklist, secrets-audit-checklist

Gate Kualiti

Setiap skill mesti lulus pengesahan sebelum ia dikeluarkan:

validation:
  file_exists: true           # Skill file at declared path
  frontmatter_valid: true     # Frontmatter parses correctly
  sections_complete: true     # Expected sections present
  tools_registered: true      # Declared tools exist in registry

Penerangan mesti 50-400 aksara dengan frasa pencetus (“Use when…”, “When you need…”) supaya Claude Code tahu bila hendak mencadangkannya.

Kami mengesahkan secara berterusan:

uv run orkestra validate --show-warnings

Ekosistem Vendor

373 skill vendor kami datang daripada:

Penyedia Skill Domain
AWS Agent 19 Perkhidmatan cloud
Anthropic 12 Penjanaan dokumen
Cloudflare 8 Pengkomputeran edge
Supabase 5 Pangkalan data
k-dense 100+ Pengkomputeran saintifik
silvainfm 4 Data science
Java Developer Kit 45+ Spring/Java
Vercel 1 Automasi browser

Setiap root vendor diisytiharkan dalam metadata.yaml:

vendor_roots:
  - path: vendor/aws-agent-skills
    provider: aws
  - path: vendor/k-dense-scientific/scientific-skills
    provider: k-dense
  - path: vendor/supabase-skills
    provider: supabase

Apabila orkestra sync berjalan, skill vendor disymlink ke dalam .claude/skills/vendor/ dengan namespace penyedianya.

Apa Yang Kami Pelajari

Keselektifan berbaloi. Amat menggoda untuk mengadaptasi segala-galanya yang kelihatan berguna. Tetapi setiap skill menelan kos token. Dengan purata 2,834 token setiap skill, kegembungan menyakitkan dengan cepat. Kadar adaptasi 13% kami mengekalkan ejen kekal ramping.

Struktur membolehkan discovery. Sistem K-tier bukan sekadar penyusunan - ia tentang portabiliti. Skill K0 boleh digunakan semula di mana-mana. Skill K4 sengaja khusus projek. Kejelasan ini membantu manusia dan ejen mencari apa yang mereka perlukan.

Dormant scope menskalakan. Anda boleh mengadaptasi beratus-ratus skill tanpa memuatkannya semua. Scope membolehkan anda membina satu registri komprehensif sambil mengekalkan tetingkap konteks ejen individu boleh diurus.

Pengubahsuaian semasa adaptasi adalah penting. Skill vendor mentah jarang sesuai dengan sistem anda. Proses ingestion - menambah metadata, memberikan tier, memperkaya tag - menjadikan skill luaran berfungsi secara dalaman.

Mining adalah berterusan. Angka 3,500 itu terus berkembang. Repo vendor baharu muncul. Corak komuniti terserlah. Aliran kerja dalaman menjadi mantap. Gelung ini tidak pernah berhenti.

Apa Seterusnya

Kami sedang mengusahakan beberapa penambahbaikan:

  1. Pengesanan gap automatik: Memberi amaran apabila kegagalan ejen yang biasa boleh ditangani oleh satu skill yang belum diadaptasi
  2. Aliran kerja deprecation skill: Proses formal untuk menyara skill yang telah digantikan atau tidak digunakan
  3. Kebergantungan silang-skill: Pengisytiharan eksplisit prasyarat skill
  4. Analitik penggunaan: Menjejaki skill mana yang benar-benar dipanggil oleh ejen berbanding sekadar dimuatkan

Gelung skill mining adalah infrastruktur. Ia tidak glamour. Tetapi itulah yang menjadikan 41 ejen berfungsi secara koheren dengan 466 keupayaan sambil kekal dalam had konteks.

Itulah kisah bagaimana 3,500 menjadi 466. Bukan dengan mengabaikan 3,000 - tetapi dengan menilainya secara sistematik dan mengadaptasi hanya apa yang berfungsi.


Mahu melihat sistem skill beraksi? Lihat uv run orkestra skills list untuk meneroka registri semasa kami.

Bacaan berkaitan

Lagi daripada log pembinaan Maguyva