単一4GB GPUでのAirLLM 70B推論
AirLLM 70B inference with single 4GB GPU (github.com)
github.com ·
AirLLMは、レイヤー単位でGPUに流し込む方式により、4GBのGPUで70B規模のLLMを量子化なしで動作させられるライブラリです。通常はメモリに収まらない巨大モデルを、単一のGPUで扱える点が際立っています。モデルの種類を自動判定するAutoModelを備え、主要なモデルファミリーにそのまま対応します。
AirLLM 70B inference with single 4GB GPU (github.com)
github.com ·
AirLLMは、レイヤー単位でGPUに流し込む方式により、4GBのGPUで70B規模のLLMを量子化なしで動作させられるライブラリです。通常はメモリに収まらない巨大モデルを、単一のGPUで扱える点が際立っています。モデルの種類を自動判定するAutoModelを備え、主要なモデルファミリーにそのまま対応します。
DeepSeek’s V4 Flash Guts OpenAI’s Price War Within Hours, Matching Opus-Grade Output At $0.28 Per Million Tokens, As Moonshot Scales With 20,000 New NVIDIA GPUs
wccftech.com ·
DeepSeekのV4 Flashは、非常に低いAPI価格でOpus級の出力品質を提供し、OpenAIの価格戦争に即座に対抗すると報じられています。Moonshot AIが2万基のNVIDIA GPUを調達して訓練規模を拡大する動きも紹介しています。業界の価格競争が激化する中で、モデル選択のコスト判断に影響を与える情報です。
Critical CVE issued for hallucinated SQLite vulnerability
research.jfrog.com ·
SQLite向けに公開された複数のCVEが、実在する脆弱性を正しく記述しているか疑問視されています。CVSSスコアが高いにもかかわらず再現性に問題があるとして、CVEパイプラインの信頼性に関する議論を呼んでいます。セキュリティ担当者は自動化されたトリアージに注意を払う必要があります。
Show HN: Nightcrawler - A local AI pentesting agent running on a smartphone (github.com)
github.com ·
Nightcrawlerは、スマートフォン上で完全にローカルに動作する自律型ペネトレーションテストエージェントで、ネットワーク探索、サービス列挙、脆弱性検証、レポート生成までを自動で行います。1.2Bパラメータの小規模モデルをGPU上で動かし、クラウド接続を一切必要としません。小さなAIモデルで高度なセキュリティタスクを実現する点が興味深いです。
LLMs reward expertise
seangoedecke.com ·
この記事は、LLMを効果的に使うにはドメイン知識が重要だと主張しています。数学者テレンス・タオのChatGPTとの対話を例に、専門家がどのようにモデルを操るかを解説しています。単純なプロンプト技術以上に、対象分野の深い理解が結果に大きな差をもたらすことを示しています。
Prevent cognitive debt by manually retyping LLM-generated code
ankursethi.com ·
著者は、LLMが生成したコードを自動適用するのではなく、チャット上で提案を確認しながら手動で入力するというワークフローを紹介しています。コードに対する理解と認知負債の軽減を優先し、速度を犠牲にしても把握を重視しています。AIを活用しつつ、人自身の理解力を保つための実践的な方法です。
I'm (mostly) picking models on speed now, not intelligence
martinalderson.com ·
日常的なタスクではモデルの知能よりも応答速度が重要だと考える著者が、モデル選択の基準を速度にシフトしている理由を説明しています。最近の高速モデルが手頃な価格で登場したことで、実用的な選択肢が増えたことが背景にあります。応答性がUXに与える影響を重視する開発者にとって参考になる内容です。
Stateless MCP has recaptured my interest (and inspired mcp-explorer and datasette-mcp)
simonwillison.net ·
ステートレスなModel Context Protocol(MCP)に再び注目が集まり、著者が開発したmcp-explorerとdatasette-mcpという2つの新ツールが紹介されています。これらのツールを使うと、エージェントが外部APIを呼び出す際の設定が簡単になります。MCPを安全に利用するための実践的な知見も含まれています。
Stacked pull requests are now in public preview (github.blog)
github.blog ·
GitHubがスタックされたプルリクエストの機能をパブリックプレビューとして公開しました。大きな変更を複数の小さなPRに分割してレビューしやすくするための機能で、開発フローに役立ちます。まだプレビュー段階ですが、既存のGitHubワークフローとの統合が期待されます。
A deep dive into Nvidia's Vera CPU and the Olympus cores that power it
theregister.com ·
Nvidiaが初めて独自設計したCPUであるVeraと、そのカスタムArmv9.2コアの詳細を解説する記事です。モノリシックなコンピュートダイとチップレット構成のI/Oが特徴で、AIエージェント向けの性能を重視しています。ハードウェア設計に興味があるエンジニアに最適です。