J-lens Qwen3.6 是一个视觉调试器,通过雅可比透镜显示本地 Qwen3.6-27B 模型在 Apple Silicon / MLX 上每个层和 token 位置的潜在预测。

Stars

350

7 天增长

暂无数据

Fork 数

23

开放 Issue

0

开源协议

Apache-2.0

最近更新

2026-07-21

AI 仓库情报摘要
FR-AI / ANALYSIS

为什么值得关注

它为大型语言模型的机制可解释性提供了实用的交互工具,包含定制的 Metal 反向核,使得在 M4 Pro 上可在约 2.75 小时内完成全深度雅可比透镜拟合,并支持手动和反向搜索干预。

适合谁使用

  • 机制可解释性研究人员
  • AI 安全研究人员
  • 在 Apple Silicon 上运行本地大模型的开发者
  • 对模型调试感兴趣的机器学习工程师

典型使用场景

  • 检查影响模型输出但被最终响应抑制的潜在概念
  • 通过编辑潜在表示并观察输出变化来调试模型行为
  • 通过搜索产生所需安全或危险回复的编辑来测试安全对齐
  • 探索单个 token 和概念在不同层中的表示方式

项目优势

  • 定制的 Metal 反向核(针对 GDN 线性注意力层)使全深度透镜拟合在 M4 Pro 上仅需约 2.75 小时
  • 实时流式聊天模式,带有交互式网格可视化(位置×层)和可点击单元格以查看详细读取结果
  • 支持手动编辑和自动反向搜索(包括前提级交换)进行因果干预
  • 预装透镜即可使用,并可兼容来自 Neuronpedia 的外部透镜或用户自行拟合的透镜

使用前须知

  • 仅支持 Apple Silicon 的 macOS 和 MLX,无跨平台支持
  • 由于架构特定的自定义核,仅适用于 Qwen3.5 架构的模型(如 Qwen3.6-27B)
  • 透镜质量随提示数量增加而提升;捆绑的 20 个提示透镜仅用于演示,研究级使用需要 100+ 个提示

README 快速开始

Quick start

项目描述

J-space / Jacobian-lens visualizer for Qwen3.6-27B (4-bit) on Apple Silicon, ported to Apple MLX

相关仓库与替代方案

根据分类、Topic 和编程语言匹配的相似项目。

lopopolo
精选
lopopolo GitHub avatar

harness-engineering

Harness Engineering is a methodology for improving coding agent outputs by carefully crafting the environment around them—providing curated context, tools, and executable constraints that encode an organization’s nonfunctional requirements and cumulative lessons.

AI 与机器学习AI 智能体
2,390
slvDev
精选
slvDev GitHub avatar

esp32-ai

A 28.9 million parameter language model runs on an $8 ESP32-S3 microcontroller entirely on-device, generating simple stories at about 9.5 tokens per second.

AI 与机器学习大语言模型
1,960
littledivy
精选
littledivy GitHub avatar

mimic

mimic captures traffic from any iOS or web app and automatically generates a Python client library that lets you call the app's API like a regular library.

AI 与机器学习
1,482